一句话看懂:alphaXiv 收录的论文提出 LoGRA,用低秩梯度素描代替完整梯度矩阵来降低大模型强化学习后训练显存,7B 模型平均显存下降 45.7%,27B 模型可在单台八卡节点完成 1100 步以上训练。
事件核心:发生了什么
2026 年 10 月 5 日,alphaXiv 页面展示了一篇名为 LoGRA 的论文。该方法针对大语言模型强化学习后训练中显存占用过高的问题,不再为选定的注意力与 MLP 投影矩阵保存完整梯度,而是用固定随机投影把梯度列压缩成更窄的低秩素描,并在反向传播中直接累积投影贡献。
具体数据方面,在 Qwen2.5-Math-7B 上使用 DAPO-Math-7.5K 训练、MATH-500 评测,三个随机种子的平均结果显示,LoGRA 的峰值 Pass@1 为 72.33%,密集 Adam 为 72.48%;LoGRA 全流程平均训练显存为每卡 17.29 GiB,相比密集 Adam 的 31.82 GiB 下降 45.7%。在 27B 规模上,密集 Adam 在首次分配优化器状态时即显存不足,而 LoGRA 完成评估运行,平均训练显存 51.54 GiB,峰值 53.88 GiB。论文还提到,同一套压缩因子可被 rollout 引擎复用,用于策略同步,从而减少同步负载。
为什么重要
强化学习后训练正成为提升大模型推理能力的关键环节,但它的显存开销长期把不少团队挡在门外:模型能推理不等于能训练,梯度和优化器状态会迅速吃掉余量。LoGRA 的意义在于,它没有走“只训练适配器”的轻量路线,而是把压缩后的更新合并回原始权重,保留了全参数更新的形态,同时让 27B 模型在单台八卡节点上跑起来。
对行业而言,这类方法如果被验证可复现,会直接降低强化学习后训练的硬件门槛,让中小团队也能在有限算力下参与大模型推理能力的迭代。但需要注意,目前公开信息仍以论文摘要和页面素材为主,LoGRA 尚未被描述为已上线的产品功能,其长期稳定性和跨任务泛化能力还需要更多独立验证。
对用户/开发者/创作者的影响
对开发者来说,最直接的变化是训练侧显存预算可能下降。如果 LoGRA 的代码在 Molt 库中可用,团队可以在相同 GPU 上尝试更大的模型或更长的训练步数。对做推理优化和部署的工程师,rollout 引擎可以基于种子重建投影并应用紧凑更新因子,这为策略同步提供了更轻量的工程选项,不过论文并未给出端到端通信时间的实测数据。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
对使用大模型 API 或 AI 应用的用户与创作者,短期体感不会立刻变化。这项技术影响的是模型提供方的后训练成本,可能间接影响推理能力迭代速度和 API 价格,但目前没有证据表明已有商业产品接入 LoGRA。关注开源生态的开发者可以留意 Molt 库的后续更新,以及是否有团队在自有模型上复现 27B 单节点训练的结果。
值得关注的后续
第一,LoGRA 的代码是否在 Molt 库中完整开放,以及社区能否复现 7B 和 27B 的显存与精度数据。第二,预测 KL 步长控制是否在更多任务和更长训练周期中体现必要性,因为论文中无该控制的 1.5B 双种子运行也保持了稳定。第三,是否会有云厂商或模型团队把这类低秩梯度压缩方案纳入强化学习后训练管线,从而改变大模型训练的算力门槛。
来源:alphaXiv


