tile-ai / tilelang

TileLang 在 2026 年 9 月底正式支持华为昇腾 950 NPU,具备原生代码生成、自动调度与同步、SIMD/SIMT 向量编程等能力。这意味着这个基于 TVM 的开源 DSL,从 GPU 阵营进一步延伸到国产 NPU 生态。

一句话看懂:TileLang 在 2026 年 9 月底正式支持华为昇腾 950 NPU,具备原生代码生成、自动调度与同步、SIMD/SIMT 向量编程等能力。这意味着这个基于 TVM 的开源 DSL,从 GPU 阵营进一步延伸到国产 NPU 生态。

事件核心:发生了什么

据 GitHub 项目页信息,TileLang(此前仓库名为 tile-ai/tilelang)是一个面向高性能 kernel 开发的领域特定语言,用接近 Python 的语法编写 GEMM、Dequant GEMM、FlashAttention、LinearAttention 等算子,底层编译基础设施构建在 TVM 之上。项目公布的进展显示,2026-09-30 新增 Ascend 950 后端,官方支持华为昇腾 950 NPU,并提供了 GEMM、FlashAttention 等昇腾示例。

同一批更新还包括:2026-08-04 开源 TileLang LSP,为缓冲区形状、数据类型、作用域和推断布局提供 inlay hints;8 月 3 日发布 v0.1.13,引入多后端语言方言、编译器诊断源码位置、CUDA 与 Metal 新硬件路径;7 月底连续补充 Blackwell SM120 的 NVF4 block-scaled MMA,以及面向 Apple M5 的 Metal 4 cooperative-tensor GEMM。

为什么重要

AI 算力的竞争早已不只在芯片本身,软件栈能否把硬件性能真正“榨出来”同样关键。TileLang 的定位是让开发者用较高抽象写 kernel,同时保留接近手写的底层优化空间。目前公开信息显示,它正从单一 GPU 后端走向 CUDA、ROCm、Metal、LLVM CPU 和昇腾 NPU 的多后端格局。

昇腾 950 被纳入原生代码生成路径,对国内使用华为算力的大模型训练与推理团队有现实意义:过去针对 NPU 写高性能算子往往需要更深的底层积累,而 TileLang 试图把这一层门槛降下来。对 CUDA 生态而言,这不算替代,但它让“同一套 DSL 覆盖多种加速器”的设想又推进了一步。

对用户/开发者/创作者的影响

对算子与推理优化工程师,最直接的变化是多了一个可评估的昇腾开发路径:可以先跑官方 GEMM、FlashAttention 示例,再判断是否迁移自有 kernel。对使用 vLLM 类推理框架的团队,TileLang 支持 DeepSeek V3.2 稀疏 MLA、top-k 选择器等算子示例,意味着后续推理性能优化可能更多依赖这类 DSL 而非纯手工 CUDA。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

需要注意的是,v0.1.13 移除了若干旧 API,升级前应阅读兼容性说明;Apple M5、Blackwell 等新路径也仍处于逐步完善阶段,实际收益需按具体 shape 和负载验证。

值得关注的后续

一是昇腾后端能否从示例走向生产级算子库,自动调度在真实大模型负载上的表现是否稳定;二是 LSP 与 IR Lower Trace、Pass Visualizer 等调试工具能否降低团队上手成本;三是 CUDA、ROCm、Metal 与昇腾多后端并行推进时,社区维护精力是否跟得上。

来源:github

celebrityanime
celebrityanime
文章: 26721

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注