ReSPO 提出重整形序列策略优化,缓解离线强化学习梯度饥饿

Hugging Face Papers 收录的 ReSPO 论文提出用平滑双分支序列核替代 PPO 式裁剪,缓解可验证奖励强化学习中正样本梯度被抑制的问题,并在 Qwen3 稠密和 MoE 模型上报告了训练早期加速与最终分数提升。

一句话看懂:Hugging Face Papers 收录的 ReSPO 论文提出用平滑双分支序列核替代 PPO 式裁剪,缓解可验证奖励强化学习中正样本梯度被抑制的问题,并在 Qwen3 稠密和 MoE 模型上报告了训练早期加速与最终分数提升。

事件核心:发生了什么

根据 2026 年 9 月 28 日发布的论文摘要,ReSPO 针对的是 RLVR(可验证奖励强化学习)里的一个具体问题:同一批 rollout 被多次用于策略更新后,当前策略与生成数据的旧策略之间出现漂移,重要性权重分布尾部变厚。作者指出,传统裁剪策略优化存在“符号依赖的梯度饥饿”:低权重尾部中,生成不足的正向回答被压制;高权重尾部中,过度生成的负向回答却可能主导梯度。ReSPO 用来自 α-散度变分目标和指数方差控制倾斜的平滑、双分支序列级核函数替代裁剪,让正向分支对生成不足的正向回答保留非零梯度权重,同时让负向分支抑制严重过度生成的负向回答。摘要称,在 Qwen3 稠密和 MoE 模型上,ReSPO 在 rollout 复用条件下加速了早期优化、提升了最终训练分数,并在留出基准上取得更高表现。

为什么重要

RLVR 已成为大模型推理能力训练的重要路线,但 rollout 成本高,复用数据几乎是工程上的默认选择。复用越多,离线程度越高,重要性采样权重尾部就越容易失控。ReSPO 的价值不在于提出全新范式,而在于对 PPO 类裁剪机制做了一次有明确数学动机的修补:把硬裁剪换成平滑核,区分正负样本的梯度行为。如果结论在更大规模模型和更多任务上稳定成立,它可能影响后续开源强化学习训练框架的默认损失设计,也会让“长思维链正样本在早期训练中被浪费”这一问题获得更系统的关注。

对用户/开发者/创作者的影响

对训练侧开发者而言,ReSPO 属于算法层改动,不改变数据格式或推理接口,理论上可插入现有 RLVR 流水线。若后续开源实现可用,使用 Qwen3 等模型做数学、代码等可验证任务微调的团队,可能以更低 rollout 复用成本获得更稳的早期训练曲线。对应用层用户和创作者,短期不会有直接可感知变化;它影响的是模型后训练效率与推理能力上限,而非 API 价格或产品功能。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

目前公开信息仅为论文摘要,尚需关注三点:一是是否有作者开源实现或集成进主流 RL 训练框架;二是能否在更大规模模型和更多可验证任务上复现摘要中的提升;三是与 DAPO、GSPO 等同类序列级策略优化方法的直接对比结果。

来源:Hugging Face Papers

celebrityanime
celebrityanime
文章: 28553

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注