KLPO 提出无评论家异步强化学习新方法,替代 GRPO 分组采样

一篇新论文提出 KLPO 框架,试图让大语言模型智能体的异步强化学习在只用一个 rollout 的情况下完成无评论家更新,绕过 GRPO 依赖分组采样和重要性权重带来的成本与偏差问题。

一句话看懂:一篇新论文提出 KLPO 框架,试图让大语言模型智能体的异步强化学习在只用一个 rollout 的情况下完成无评论家更新,绕过 GRPO 依赖分组采样和重要性权重带来的成本与偏差问题。

事件核心:发生了什么

2026年10月6日,Hugging Face Papers 收录了一篇题为《On KL-Regularized Policy Optimization》的论文,提出一种名为 KL-Regularized Policy Optimization(KLPO)的框架。根据论文摘要,它针对的是大语言模型智能体异步强化学习中的一个现实问题:用于训练的轨迹往往来自旧检查点,推理引擎给出的概率即使参数相同也和训练器不一致。

常见的处理办法有两种:要么裁剪重要性比率,但这会让更新产生偏差;要么像 GRPO 那样为每个提示词采样一组回复,而当任务 episode 很长时成本会很高。KLPO 的做法是把 KL 正则项锚定在采样器一侧,使带正则的改进步骤拥有闭式 Gibbs 解,再通过最小二乘拟合对数比率最优性条件,让采样器概率通过对数比率进入,从而不需要重要性权重。

摘要还提到,把回归截距消去后,原本难以处理的 log-partition 函数可以被信号在采样器上的均值加上采样器到训练器的 KL 散度替代。对于 token 级策略镜像下降目标,论文声称梯度可从终端回报算出,无需评论家;在随机工具输出下也可使用采样器中心的得分或单条轨迹残差。论文进一步证明 KL 项的独立蒙特卡洛估计能保持梯度无偏,推导了更便宜 top-K 和二元近似下的精确 KL 差距,并指出 SPPO、GPO、REBEL、BPO 都是 KLPO 的特例。

为什么重要

异步强化学习在 LLM 智能体训练中越来越常见,但推理与训练之间的概率不一致、rollout 陈旧、以及评论家网络带来的额外算力开销,一直让这条路线偏贵且难调。KLPO 如果被后续实验验证,其意义在于把“一组回复换稳定性”的思路改成“用采样器自身轨迹的最小二乘拟合换稳定性”,在数学上保持正则化目标的同时减少采样和显存负担。

这对正在用强化学习微调智能体、工具调用模型或多步推理模型的团队有一定参考价值,尤其是在算力有限、episode 较长、或者需要异步大规模 rollout 的场景下。论文把多个已有方法统一成特例,也为后续比较不同算法提供了更清晰的框架。需要说明的是,上述内容目前仅来自摘要,未核验全文实验和同行评审情况,不代表已经有可直接使用的开源实现或产品。

对用户/开发者/创作者的影响

对开发者和研究者而言,KLPO 描述的是一个训练算法层面的改进,普通用户和内容创作者短期内不会直接感知。如果后续代码开源且实验可复现,使用开源大模型做智能体强化学习的团队,可能降低对分组采样和评论家网络的依赖,节省推理和训练算力。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对做 AI 应用开发的团队来说,值得留意的是这类方法能否进入主流训练框架,例如是否会被集成到现有 RLHF/RLVR 工具链。如果落地,训练长程工具调用或复杂任务智能体的成本曲线可能会有所变化,但目前公开信息显示这仍是论文层面的提议,距离生产可用还有距离。

值得关注的后续

一是论文是否公开完整实验代码和复现结果,尤其是与 GRPO 在长 episode 任务上的算力与效果对比。二是 KLPO 声称的“无需评论家、每个提示词一个 rollout”在真实异步训练环境中的稳定性是否成立。三是这类方法是否会被主流开源训练框架采纳,以及与 SPPO、GPO、REBEL、BPO 等已有方法的关系是否在实践中得到验证。

来源:Hugging Face Papers

celebrityanime
celebrityanime
文章: 28095

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注