华为与DeepSeek开源昇腾算子库,降低CUDA迁移成本能吸引开发者吗

DeepSeek 在华为支持下开源了面向昇腾 950 系列的两组生产级算子与通信库,目标是让 MoE 大模型的训练推理代码更容易从 CUDA 迁移到国产算力。但基准测试跑在非公开的概念验证硬件上,生态号召力仍与英伟达 CUDA 有明显差距。

一句话看懂:DeepSeek 在华为支持下开源了面向昇腾 950 系列的两组生产级算子与通信库,目标是让 MoE 大模型的训练推理代码更容易从 CUDA 迁移到国产算力。但基准测试跑在非公开的概念验证硬件上,生态号召力仍与英伟达 CUDA 有明显差距。

事件核心:发生了什么

据 TechRadar 报道,DeepSeek 公布了面向华为昇腾加速器的开源基础设施组件。其中两个仓库是全新项目:负责矩阵乘法的 DeepGEMM-Ascend,以及面向混合专家模型依赖的全对全通信库 DeepEP-Ascend。其余被提及的 TileKernels、DeepSelect、FlashMLA 并非新项目,只是做了针对昇腾的更新。一个容易被忽略的事实是,被彭博社称为“中国版 CUDA”的 TileLang 并非 DeepSeek 自研,它于 2025 年 1 月开源,其昇腾适配器在 2025 年 9 月发布在独立仓库中。

为什么重要

这次发布的关键不是性能宣称,而是降低迁移成本。DeepGEMM-Ascend 保持了与 CUDA 版本相同的 Python 包名和 API 形态,DeepEP-Ascend 的公开缓冲区接口也对齐英伟达版本。对开发者而言,这意味着已有代码有可能以更小改动跑在昇腾上。这直指英伟达护城河的构成——多数团队放弃 CUDA 或自建替代方案的成本过高。不过,由于 TileLang 同时支持 CUDA 与昇腾后端,它更像是一个多家国产加速器厂商正在共同收敛的抽象层,而不是专门针对英伟达的武器。

对用户/开发者/创作者的影响

目前公开信息显示,这组工具的使用门槛很高:DeepGEMM-Ascend 需要昇腾 950 系列和 CANN 9.20,DeepEP-Ascend 需要支持 UBMEM 互联的昇腾 950 芯片,实际受众主要限于华为自身工程师和能接触到该硬件的少数中国 AI 实验室。社区热度也有限,DeepGEMM-Ascend 约 515 星、39 个分支,而 CUDA 版 DeepGEMM 约 8522 星;DeepEP-Ascend 约 224 星,对比原版 DeepEP 超过 1 万星。此外,有研究者曾向媒体描述 CANN 让昇腾芯片难用且不稳定,一线开发者对 910B 的体验也有抱怨,华为需要派工程师驻场协助客户迁移 CUDA 训练代码。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

第一,观察 DeepGEMM-Ascend 和 DeepEP-Ascend 能否从概念验证硬件走向公开发布的芯片出货,否则迁移案例难以规模化。第二,关注 TileLang 是否吸引更多国产加速器厂商加入同一抽象层,形成真正的生态标准。第三,注意美国出口管制与中国进口政策是否继续把昇腾推到不得不用的位置,这会决定开发者是主动选择还是被动迁移。

来源:TechRadar

celebrityanime
celebrityanime
文章: 27922

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注