DeepSeek 开源面向华为昇腾平台的基础设施组件

DeepSeek 把此前只服务英伟达平台的一套底层软件组件,完整搬到了华为昇腾算力平台上并开源,包括编程语言编译工具、矩阵运算库和分布式通信库。这意味着国产 AI 芯片在“软件好不好用、性能能不能跑满”这件事上,多了一套经过真实大模型训练验证的工具链。

一句话看懂:DeepSeek 把此前只服务英伟达平台的一套底层软件组件,完整搬到了华为昇腾算力平台上并开源,包括编程语言编译工具、矩阵运算库和分布式通信库。这意味着国产 AI 芯片在“软件好不好用、性能能不能跑满”这件事上,多了一套经过真实大模型训练验证的工具链。

事件核心:发生了什么

DeepSeek 正式开源了面向华为昇腾平台的基础设施组件,覆盖 TileLang 高级语言编译工具、计算库和分布式通信库。这些组件与此前英伟达平台的开源组件一一对应,相当于把同一套软件栈平移到了昇腾架构上。

具体开源项目包括:TileLang、DeepGEMM-Ascend、DeepEP-Ascend、TileKernels、FlashMLA 和 DeepSelect。它们分别负责高性能算子编程、通用矩阵运算加速、大规模跨设备通信、向量计算与访存、稀疏注意力以及数据筛选。

素材提到,DeepSeek V4 系列模型训练中大部分算子的实现,已经跑在 TileLang 上。在多个关键测试用例里,昇腾版组件的计算与通信性能已接近硬件上限。研发过程中,华为团队参与推进了基于昇腾 950 的 128 卡超节点方案,并对计算和通信做了深度优化。

为什么重要

大模型训练和推理的效率,不只取决于芯片本身,更取决于软件栈能不能把芯片性能压榨出来。英伟达的护城河很大程度上来自 CUDA 生态,开发者习惯、库函数、编译器、通信原语都围绕它积累多年。昇腾等国产算力平台过去常被诟病“硬件参数好看,但实际开发难、性能打折”,核心短板就在这里。

TileLang 的价值在于它试图同时解决两个问题:编程比 CUDA 更简单,同时不牺牲硬件性能上限。这套路线先在英伟达平台验证,再迁移到昇腾,说明它并非只针对某一家的定制方案,而是有跨芯片复用的可能。对于希望降低单一算力依赖的团队来说,这比单纯堆卡更有实际意义。

对用户/开发者/创作者的影响

对开发者和算法团队来说,最直接的变化是:如果手头有昇腾算力,现在可以评估用 TileLang 写算子、用 DeepGEMM 和 FlashMLA 加速矩阵运算与长上下文注意力、用 DeepEP 做多卡通信,而不必从底层 Ascend C 指令开始啃。这能显著减少适配时间。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对使用 DeepSeek 模型或 API 的用户和 AI 应用团队,短期体验未必立刻改变,但训练侧对昇腾的适配度提高,可能影响未来推理成本、部署选择和供给稳定性。对内容创作者而言,工具链层面的进展不会直接改变创作方式,但它决定了大模型服务背后的算力成本曲线,进而影响 API 价格和可用性。

值得关注的后续

一是这些组件在真实生产环境中的性能表现,是否与测试用例中“接近硬件上限”的说法一致;二是除华为外,是否有其他 AI 芯片厂商跟进接入 TileLang 生态,形成跨平台示范;三是 DeepSeek 后续模型训练是否会更多比例地跑在昇腾上,以及这是否会体现在模型发布节奏和 API 成本上。目前公开信息显示,双方合作仍处于持续推进阶段,具体落地规模尚未披露。

来源:公众号:DeepSeek(深度求索)

celebrityanime
celebrityanime
文章: 26432

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注