一句话看懂:DeepSeek 在 9 月 30 日开源了面向华为昇腾平台的一组底层基础设施,包括 TileLang 编译工具及五个计算、通信组件,让开发者第一次能在昇腾 NPU 上用接近英伟达生态的接口跑大模型算子和分布式通信。
事件核心:发生了什么
9 月 30 日,DeepSeek 宣布开源面向华为昇腾算力平台的基础设施组件。这套组件与此前英伟达版本一一对应,包含矩阵计算库 DeepGEMM、跨设备通信库 DeepEP、通用算子库 TileKernels、稀疏注意力内核 FlashMLA、TopK 筛选算子 DeepSelect,以及负责算子编写的 TileLang 编译器昇腾后端。目标硬件围绕昇腾 950 展开:TileKernels 要求 CANN 9.2.0 及以上,DeepEP Ascend 的现有测试尚未验证其他昇腾代际或 CANN 版本。DeepSeek 同时披露,已与华为共同推进基于昇腾 950 的 128 卡超节点方案,并做了计算和通信联合优化。
为什么重要
过去开发者要迁移到昇腾,通常得深入 CANN 和 Ascend C 写自定义算子,门槛高、迁移成本大。这次 DeepSeek 把训练中实际使用的算子和通信实现按英伟达版本的接口对齐后开源,等于把迁移路径铺到接口层,已有调用代码有机会复用。对 DeepSeek 自身而言,V4 系列训练的大部分算子由 TileLang 承载,每个 TileLang 算子都有昇腾对应的高性能实现,说明其训练栈并非只绑定 CUDA;对昇腾生态而言,这是来自头部模型公司而非硬件厂商的工程背书。它不意味着昇腾已能无缝替代英伟达,但补上了国产算力在软件栈中层最关键的一块。
对用户/开发者/创作者的影响
已有英伟达版本调用代码的团队,可以先核对 API 对齐的部分,再针对精度差异做适配。DeepGEMM-Ascend 的量化缩放因子存储格式与英伟达版本不同,迁移时需调整数据布局;DeepSelect 昇腾版当前只支持 BF16 输入;FlashMLA 仍有部分融合内核和稠密注意力内核仅支持 CUDA。需要自定义算子的团队则可通过 TileLang 昇腾后端编写内核,用接近 Python 的语法描述数据类型、分块与计算,由编译器完成代码生成、调度和同步。普通用户短期内无直接感受,但云端调用昇腾推理服务的成本与可用性,长期会受这类底层开源影响。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
一是 DeepEP Ascend 中流水线并行、上下文并行、数据并行相关通信能力的开发进度;二是除昇腾 950 外的代际适配何时明确,以及 CANN 版本兼容范围是否会扩大;三是这套组件与上层框架、模型实现的实际集成效果,公开资料尚未给出与其他昇腾推理方案的代码继承关系,仍待开发者用自身负载验证正确性与性能。
来源:InfoQ CN


