DiffGate 结合 GRPO 与教师引导,提升大模型代码数学推理能力

针对大语言模型后训练中 on-policy distillation 与 RLVR 各自的盲区,研究者提出 DiffGate,将教师指导只用于失败轨迹并按难度缩放,在 Qwen3-0.6B/1.7B 学生模型上提升了代码与数学任务的 pass@8 指标。

一句话看懂:针对大语言模型后训练中 on-policy distillation 与 RLVR 各自的盲区,研究者提出 DiffGate,将教师指导只用于失败轨迹并按难度缩放,在 Qwen3-0.6B/1.7B 学生模型上提升了代码与数学任务的 pass@8 指标。

事件核心:发生了什么

根据 Hugging Face Papers 上 2026 年 10 月 3 日收录的论文摘要,当前大模型后训练常用的 on-policy distillation(OPD)虽然在学生模型自己生成的轨迹上做监督,缓解了训练与测试的不匹配,但其目标仍以 token 为单位,缺少对整条推理路径是否正确的判断。而带可验证奖励的强化学习(RLVR),尤其是 GRPO,能提供结果层面的信号,却面临奖励稀疏和信用分配粗糙的问题。

论文作者指出,两者存在互补盲区:教师信号密集但和 rollout 是否正确关联较弱;组相对奖励能反映任务成功与否,但 token 级信用分配较粗,且在全失败的组上会消失。DiffGate 的做法是把 GRPO 与选择性、有界的教师指导结合,只对失败轨迹施加教师监督,并按组难度缩放,同时做平滑边界约束,避免极端师生差异主导优化。摘要显示,在 Qwen3-0.6B 和 Qwen3-1.7B 学生模型上,DiffGate 相比匹配的 GRPO 在代码任务 avg@8 上分别提升 1.7 和 1.8 分,pass@8 分别提升 1.6 和 5.7 分;数学任务 avg@8 与 GRPO 差距在 0.5 分以内,pass@8 分别提升 1.1 和 3.9 分。目前公开信息显示,这些结果来自论文摘要,尚未核验全文实验细节。

为什么重要

大模型后训练正从单纯的模仿学习走向 RL 与蒸馏的混合路线。DiffGate 的意义不在于提出一个全新模型,而是把“谁来提供监督”和“在哪条轨迹上提供监督”分开:验证器决定哪些轨迹需要教师指导,教师则在失败轨迹内部给出密集的 token 级更新方向。这种 outcome-gated 的思路,可能影响开源模型和闭源模型在推理能力上的训练效率,也为解决 GRPO 全失败组奖励消失问题提供了一种可参考的方案。

对用户/开发者/创作者的影响

对开发者和研究者而言,DiffGate 的价值在于它展示了一条复用现有 GRPO 训练管线、只对失败样本引入教师模型的路径。如果后续代码开源并验证可复现,小参数量学生模型在代码和数学任务上的 pass@8 提升,可能降低推理能力训练对大规模算力和全量教师蒸馏的依赖。对使用 AI 编程助手或数学推理 API 的普通用户,短期影响仍取决于该方法是否被主流训练框架或模型厂商采纳,目前公开信息尚未显示有产品直接集成 DiffGate。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

第一,论文是否会公开完整实验、消融结果和训练代码,尤其是“失败轨迹”的判定和难度缩放的具体实现。第二,DiffGate 能否在更大参数量模型、更多任务类型或真实生产训练中保持收益。第三,GRPO 及其变体仍是开源后训练的重要基线,若有团队将 DiffGate 集成到现有训练框架,可能影响后续模型在代码和数学 benchmark 上的表现。

来源:Hugging Face Papers

celebrityanime
celebrityanime
文章: 27874

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注