在NVIDIA GB300 NVL72上创造MoE预训练世界纪录

NVIDIA 在 GB300 NVL72 系统上,用 256 块 GPU 实现了 DeepSeek-V3 671B 模型的预训练,每块 GPU 达到 1,648 TFLOPs(万亿次浮点运算/秒)的算力利用率,比上一代 GB200 NVL72 提升了约 3 倍,创造了混合专家(MoE)模型预训练速度的世界纪录…

在NVIDIA GB300 NVL72上创造MoE预训练世界纪录

一句话看懂:NVIDIA 在 GB300 NVL72 系统上,用 256 块 GPU 实现了 DeepSeek-V3 671B 模型的预训练,每块 GPU 达到 1,648 TFLOPs(万亿次浮点运算/秒)的算力利用率,比上一代 GB200 NVL72 提升了约 3 倍,创造了混合专家(MoE)模型预训练速度的世界纪录。

事件核心:发生了什么

NVIDIA 官方博客宣布,在其最新的机架级系统 GB300 NVL72 上,使用 Megatron Core 训练框架,对 DeepSeek-V3 这个拥有 6710 亿参数(但每次推理只激活约 370 亿参数)的 MoE 模型进行了预训练。结果是每 GPU 交付了 1,648 TFLOPs 的算力。作为对比,上一代 GB200 NVL72 系统的早期软件版本仅达到 606 TFLOPs。这一成绩的取得,并非仅靠更快的芯片,而是系统级协同设计的成果:包括第五代 NVLink 提供的每 GPU 1.8 TB/s 的机内互联带宽、ConnectX-8 超网卡、Quantum-X800 交换机,以及 BlueField DPU 对基础设施服务的卸载。

为什么重要

这一结果揭示了当前大模型训练的一个核心瓶颈转向:当计算效率提升后,通信成为了新焦点。MoE 架构虽能大幅降低每 token 的计算成本(类似“招之即来,挥之即去”地调用专家模块),但每次训练都需要在所有 GPU 之间进行全对全(all-to-all)通信。如果网络带宽或延迟跟不上,GPU 就会陷入“等数据”的空闲状态,浪费算力。NVIDIA 这次证明,通过机内 NVLink 的高带宽、全双工、非阻塞互联,以及机外高速网络的协同,MoE 训练瓶颈能被有效化解。这意味着,未来的算力竞争,将从单纯的芯片算力比拼,转向“计算-互联-网络-软件”整栈系统的综合能力较量。

对用户/开发者/创作者的影响

对于 AI 创业公司和开发大模型的研究团队来说,这一结果是“性价比”信号:
1. 训练成本可能降低:在相同的硬件投入下,预训练速度提升约 3 倍,意味着耗时更短,电力和时间成本都将显著下降。
2. 更大模型成为可能:更高的通信效率让训练极致规模(数千亿参数)的 MoE 模型更具经济可行性,过去需要在多个机架间“绕路”的通信,现在能在单机内高效完成。
3. 框架兼容性值得关注:NVIDIA 提及已主动优化了开源框架 TorchTitan 和 JAX 在 GB300 上的运行效率,这表明开发者不需要完全锁定在 Megatron Core 生态中,但也需关注相关社区工具的适配进度。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

第一,GB300 NVL72 产品的具体上市时间和价格尚未公布,企业客户需评估其投资回报周期。第二,这一纪录是在特定模型(DeepSeek-V3)和特定框架(Megatron Core)下取得的,其他 MoE 模型或训练框架的表现需要进一步验证。第三,AMD 或云服务商自研芯片如何通过其互联技术(如 Infinity Fabric)追赶 MoE 训练效率,是行业格局的重要变量。最后,目前公开信息显示,这些优化主要针对训练场景,其在推理阶段的部署效率和成本如何,还需后续数据。

来源:NVIDIA Generative AI Blog

celebrityanime
celebrityanime
文章: 14539

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注