NeMo-DCR发布:万亿参数Agentic RL的增量重拟合提速40倍

英伟达提出NeMo-DCR方案,通过只传输权重变化量而非全量检查点,将万亿参数强化学习跨区域同步时间从87.5分钟压缩到150秒,并保证比特级精确。

一句话看懂:英伟达提出NeMo-DCR方案,通过只传输权重变化量而非全量检查点,将万亿参数强化学习跨区域同步时间从87.5分钟压缩到150秒,并保证比特级精确。

事件核心:发生了什么

根据Hugging Face Papers上2026年10月6日公开的论文摘要,英伟达研究人员提出了一种名为NeMo-DCR(Delta-Compressed Refit,增量压缩重拟合)的方法,用于解决Agentic RL中训练集群与推理集群之间的权重同步瓶颈。

在跨集群的Agentic RL流程中,每次策略更新都需要把训练侧的权重同步到生成侧。摘要指出,传输一个1T规模的全量检查点在两个AWS区域之间耗时约87.5分钟。而对BF16训练的测量显示,每一步大约只有1%的权重存储值发生变化。NeMo-DCR利用这一稀疏性,只发送变化部分,同时在接收端保证与全量重拟合完全相同的参数和缓冲区比特。在3%和5%的变化率下,对30B到1T规模模型的增量重拟合比纯传输全量检查点的参考方案快12到40倍;1T模型在3%变化率下通过中继树传输仅需150秒,而原方案需要87.5分钟。

为什么重要

Agentic RL把训练和生成拆解到不同集群,已经是扩展强化学习规模的主流思路。但每一步更新都必须等权重传到推理集群才能开始下一批生成,这个同步环节会直接卡住整个训练循环的吞吐。此前一些系统也试图利用权重变化的稀疏性,但在放置规则、精确性或效率上各有妥协,往往需要重组完整张量或使用跨集群集合通信,且中途失败后难以恢复。NeMo-DCR的卖点是把“只传变化”和“比特级精确”同时做到,且不依赖跨集群allreduce,这为训练集群与推理集群在地理上分离的部署方式提供了更可行的工程路径。

对用户/开发者/创作者的影响

对做大模型训练和强化学习后训练的团队来说,跨区域权重同步延迟一直是影响迭代速度的实际成本。如果该方法后续被集成到英伟达的NeMo框架或相关推理服务中,使用其训练栈的开发者可能在跨集群Agentic RL场景下获得更短的策略更新等待时间,从而降低单位实验的算力空转。对于依赖大规模后训练的服务提供商,这意味着跨区域部署的可行性上升。不过目前公开信息仅为论文摘要,尚无产品化时间表和第三方复现结果,普通开发者和创作者暂时不会直接接触到相关API或工具。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

第一,是否有开源实现或进入NeMo正式版本,这决定普通开发者能否实际使用。第二,在超过3%变化率或非BF16精度条件下,增量同步的效率优势是否仍然成立。第三,同类工作如字节跳动的相关方案或DeepSeek的RL训练基础设施是否会跟进类似的增量同步思路。

来源:Hugging Face Papers

celebrityanime
celebrityanime
文章: 27842

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注