deepseek-ai / DeepGEMM

DeepSeek 开源了统一的高性能 GPU 张量核心算子库 DeepGEMM,把大模型训练和推理中最吃算力的几类核心计算整合进一套轻量 CUDA 代码,安装时无需编译 CUDA,却在多种矩阵形状上追平甚至超过专家手工调优的库。

一句话看懂:DeepSeek 开源了统一的高性能 GPU 张量核心算子库 DeepGEMM,把大模型训练和推理中最吃算力的几类核心计算整合进一套轻量 CUDA 代码,安装时无需编译 CUDA,却在多种矩阵形状上追平甚至超过专家手工调优的库。

事件核心:发生了什么

根据其 GitHub 仓库信息,DeepGEMM 是一个统一的张量核心算子库,覆盖现代大语言模型的关键计算原语:FP8、FP4、BF16 精度的 GEMM,融合通信的 MoE(Mega MoE),面向 lightning indexer 的 MQA 打分,以及 HyperConnection 等。所有算子通过 DeepJIT 在运行时编译,安装阶段不需要 CUDA 编译。

它的时间线相当密集:2025 年 4 月宣称在 H800 上达到最高 1550 TFLOPS;2025 年 7 月完成重构并同时支持 SM90 / SM100;2025 年 9 月加入 DeepSeek v3.2 的 indexer 打分算子;2026 年 4 月加入 Mega MoE、FP8xFP4 GEMM、PDL 和更快的 JIT 编译;2026 年 9 月 10 日进一步加入 Sparse Indexer、Mega Gate、Mega mHC 等优化;2026 年 9 月 30 日更新还提到 DeepGEMM Ascend 版本。仓库强调设计刻意保持简单,只保留少量核心 kernel 函数,并借用了 CUTLASS 与 CuTe 的部分概念但避免重度依赖其模板体系。

为什么重要

算力是大模型竞争中最硬的成本项,而 GEMM 和 MoE 通信又是训练与推理里占比最高的计算环节。DeepGEMM 把 FP8、FP4 低精度矩阵乘与 MoE、indexer、HyperConnection 这些 DeepSeek 自家模型路线上反复出现的能力,打包成一个免安装编译的开源库,等于把内部优化经验对外释放。目前公开信息显示,它在多种矩阵形状上性能与专家调优库持平或更好,同时代码量小、易读,这对希望学习 NVIDIA GPU kernel 优化的开发者是可用的教材级资源。对行业而言,它进一步强化了“开源算子库 + 低精度 + MoE”的技术路线,也可能压缩商业算子库的溢价空间。

对用户/开发者/创作者的影响

对开发者来说,最直接的价值是接入门槛低:只需 Python 3.8 以上、CUDA 12.9 以上、PyTorch 2.3 以上,并且安装时通过 DeepJIT 运行时编译,不必在部署环境里配置完整 CUDA 编译链路。做 MoE 推理或微调、尤其是采用 contiguous 或 masked 分组 GEMM 的团队,可以优先评估。需要注意接口约定:命名遵循 D = C + A @ B,输入为 NT 布局,SM90 只支持 NT,SM100 支持 NT/TN/NN/TT;缩放因子在 SM90 用 FP32,SM100 用打包的 UE8M0 格式。此外输入转置、FP8 量化等操作仍需用户自己完成或融合到前序 kernel。对使用 DeepSeek 模型 API 或自建推理服务的团队,这更多是底层效率改进,普通终端用户短期内感知有限。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是 DeepGEMM Ascend 版本的实际成熟度和性能数据,这关系到它能否从 NVIDIA 生态扩展到国产算力;二是 2026 年 9 月这轮 Sparse Indexer、Mega Gate 等优化是否会同步进入 DeepSeek 正式模型或 API 服务;三是 SM100 / 后续架构上的性能能否继续保持对主流商业库的优势,以及社区是否围绕 DeepJIT 形成二次开发生态。

来源:github

celebrityanime
celebrityanime
文章: 27568

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注