一句话看懂:LMSYS(Chatbot Arena 团队)在 Miles 框架中实现了基于 NVIDIA Blackwell 硬件原生格式的强化学习方案,支持端到端 MXFP8(8 位)和逐 token NVFP4(4 位)精度,大幅减少训练和推理之间的精度不匹配,同时降低推理耗时。
事件核心:发生了什么
2026 年 7 月 29 日,LMSYS 团队在 Miles 训练框架中发布了两套针对 Blackwell 架构设计的低精度强化学习方案。第一套是端到端 MXFP8,覆盖了模型 rollout、前向传播、权重梯度 GEMM 和数据梯度 GEMM 全部环节。第二套是逐 token NVFP4,专门针对 MoE(混合专家)模型中的专家权重,采用在线逐 token 激活缩放策略。这两套方案都提供了精细的精度控制,允许用户指定部分层(如最终层)保留 BF16 精度。在 8 块 B200 GPU 上使用 Qwen3-30B-A3B 模型进行的消融实验中,BF16 和五种低精度配置的奖励曲线几乎重叠,而 MXFP8 和 NVFP4 方案显著缩短了 rollout 时间。
为什么重要
此前,强化学习中训练和推理使用不同精度(如 BF16 训练配合 FP8 推理)会导致策略不一,使模型效果退化。LMSYS 的方案在 Blackwell 硬件上实现了全流程精度统一,从 SGLang 推理、Megatron 训练、检查点转换到实时权重更新都遵循同一精度合约。MXFP8 利用 Blackwell 原生的一维块缩放格式(每 32 个 E4M3 值共享一个 E8M0 比例尺),而 NVFP4 则采用两级缩放结构(粗粒度 FP32 比例尺 + 细粒度 E4M3 比例尺),充分发挥了 B200/B300 及未来 Rubin GPU 的 FP4 算力(B200 可达 9 PFLOPS,B300 可达 13.5 PFLOPS)。这种原生方案比 Hopper 时代的软件缩放方案更高效,可能成为 Blackwell 上低精度强化学习的事实标准。
对用户/开发者/创作者的影响
对于使用 MoE 大模型进行强化学习的开发者,这套方案直接降低了显存占用和推理计算成本。MXFP8 和 NVFP4 在 Miles 框架中已与 TransformerEngine、FlashInfer、cuDNN 等组件集成,开发者只需配置精度策略即可使用。更关键的是,方案引入了位精确(bit-exact)的量化器合约,确保 TransformerEngine 和 FlashInfer 之间的权重更新不会引入可避免的“训练-推理不匹配”,这意味着模型在训练时学到的能力能完整保留到推理部署中。Miles 框架已公开 NVFP4 配方,开发者可立即尝试。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
首先,LMSYS 团队计划去掉训练时额外保留的 BF16 权重副本,这会进一步降低显存使用,可能使 4 位强化学习在更大模型上可行。其次,Blackwell 原生精度方案是否会带动其他框架(如 PyTorch FSDP v2 或 DeepSpeed)跟进。最后,随着 Rubin GPU 的 FP4 算力进一步提升(35 PFLOPS),这类低精度强化学习方案在大规模 MoE 模型上的性价比可能出现质变。


