TRACE:面向MoE大模型FP4强化学习的训练-推理量化对齐框架

一篇新论文提出 TRACE,用 rollout 端的量化结果反向指导训练端的 FP4 舍入决策,以缩小两条执行路径的数值差距,让 MoE 大模型在 RL 训练中实现低精度 rollout,并报告最多 5.4 倍加速。

一句话看懂:一篇新论文提出 TRACE,用 rollout 端的量化结果反向指导训练端的 FP4 舍入决策,以缩小两条执行路径的数值差距,让 MoE 大模型在 RL 训练中实现低精度 rollout,并报告最多 5.4 倍加速。

事件核心:发生了什么

根据 Hugging Face Papers 收录的论文摘要,这篇题为 TRACE 的工作于 2026 年 10 月 6 日公开,针对的是大规模语言模型强化学习后训练中的算力与显存瓶颈。RL 训练涉及大量 rollout 生成,如果能把这一环节压到 FP4 精度,开销会显著下降。作者指出,已有 FP4 RL 方法多在训练路径和 rollout 路径上分别优化量化精度,却没有直接对齐两者之间的差异。TRACE 的做法是把 rollout 侧的量化结果拿来指导训练侧的 FP4 舍入,同时用一套量化信息缓存机制,选择性保留深层网络的尾数与 scale 信息,以控制由此带来的存储和通信成本。论文在四个大规模 MoE 语言模型上、覆盖推理、编程和长周期 RL 任务做了评测,摘要称可实现权重/激活与 KV-cache 的联合 FP4 rollout,RL 表现与 BF16 rollout 相当,rollout 最多加速 5.4 倍。

为什么重要

MoE 架构目前是主流大模型扩展参数量的常见路线,但训练和 rollout 阶段的显存与带宽压力也让 FP4 这类低精度方案更有吸引力。TRACE 的价值在于把量化问题从“分别做准”推进到“两条路径对齐”,这更贴近 RL 训练里训练与采样交替进行的真实工程约束。如果这类方法能在更多模型和任务上复现,开源与闭源团队在 RL 后训练上的算力门槛可能降低,也会影响低精度推理与训练框架的竞争重点:从单纯追求位宽压缩,转向 train-rollout 一致性和缓存效率。需要注意,以上均基于论文摘要,未核验全文实验与同行评审状态。

对用户/开发者/创作者的影响

对开发者而言,如果 TRACE 的思路被后续框架吸收,未来在 MoE 模型上做 RL 微调或推理时,可能会看到更多 FP4 的默认选项,尤其是在 rollout 密集型的智能体、代码生成和长周期任务里。对企业采购和算力规划来说,低精度 rollout 如果真能保持与 BF16 接近的效果,单位训练成本有望下降,但现阶段仍属研究阶段,不适合直接按“已落地”来做预算。对普通用户和创作者,短期更可能感受到的是模型侧 RL 训练迭代加快、推理成本下探的间接影响,而非某个具体产品更新。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是 TRACE 能否在更多模型规模、非 MoE 架构和不同 RL 算法上复现结论;二是量化信息缓存带来的额外开销,在真实训练集群中是否仍具性价比;三是主流训练框架、推理引擎或开源项目是否会跟进类似的 train-rollout 对齐机制,而不是只停留在论文层面。

来源:Hugging Face Papers

celebrityanime
celebrityanime
文章: 28023

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注