一句话看懂:NVIDIA 用 Transformer Engine 配合 JAX,把 DeepSeek-V3 在 GB200 上的无丢弃 MoE 训练从 103 TFLOPS/GPU 提升到 1068 TFLOPS/GPU,提升约 10.4 倍,说明 MoE 训练的瓶颈正从算力本身转向通信与稀疏计算效率。
事件核心:发生了什么
NVIDIA 在开发者博客中介绍,如何借助 NVIDIA Transformer Engine 在 JAX 中加速无丢弃(dropless)MoE 训练。以 DeepSeek-V3 在 NVIDIA GB200 上的训练为例,未做优化的基线只有 103 TFLOPS/GPU,且跨 GPU 通信占累计内核时间的 84%;引入针对性内核优化后,性能提升到 1068 TFLOPS/GPU,提升约 10.4 倍。
MoE 是 DeepSeek、Qwen、Mixtral 等模型采用的架构方向,通过路由器把 token 动态分配给 Top-K 专家网络,用条件计算替代全量稠密 FFN。难点在于每个专家收到的 token 数不同,形成不规则张量,传统矩形 GEMM 难以高效处理,专家并行下的 all-to-all 通信也容易让 GPU 空转。
为什么重要
无丢弃 MoE 与基于容量的 MoE 是两条路线。后者给每个专家固定 token 预算,溢出部分直接丢弃或补齐,计算规整但牺牲模型质量或浪费算力。无丢弃 MoE 则保证每个 token 都被选中专家处理,对模型质量更友好,却要求内核原生支持变长 token 数和动态 shape。
目前公开信息显示,Transformer Engine 为 JAX 提供了组感知的 MXFP8 量化、专家矩阵乘上的 MXFP8 分组 GEMM,以及优化后的专家并行 dispatch/combine 操作。这意味着 MoE 训练的效率竞争,正在从堆卡转向通信调度、低精度量化和稀疏内核的工程能力。
对用户/开发者/创作者的影响
对使用 JAX 训练大模型的团队,这套方案提供了一条可参考的优化路径:如果不规则张量、all-to-all 通信和分组 GEMM 没有专门优化,MoE 的算力利用率会非常低。对应用开发者来说,MoE 训练效率提升可能传导为更低的开源模型训练成本,但短期内不会直接改变 API 价格或推理体验。对企业采购而言,GB200 上的性能数据值得关注,但应结合自身并行策略、网络拓扑和框架栈评估,不宜直接套用。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
一是 Transformer Engine 的 MoE 优化是否会更多进入 JAX 生态并支持主流训练框架;二是 MXFP8 分组 GEMM 在更多模型和集群规模上的稳定性;三是 DeepSeek、Qwen 等开源 MoE 路线是否会因此进一步降低训练门槛,带动更多团队采用无丢弃方案。


