一句话看懂:研究者 Michael Noukhovitch 在一篇新论文与博文中指出,LLM 的强化学习后训练存在”马太效应”——模型只会把简单题做得更好,难题几乎原地踏步;他提出”Never Give Up”方法来缓解这一问题。
事件核心:发生了什么
这篇发布于 2026 年 9 月 15 日的博客,对应作者近期的 RL 后训练论文。团队用 RL 训练 Olmo 3 7B base 时,AIME 2025 评测曲线整体上升,看起来很漂亮。但把 30 道题按初始难度拆开后发现:pre-RL 模型 pass@32 全错的”硬题”训练后基本仍是 pass@32=0,提升几乎全部来自原本就能解出的简单题和中档题。作者把这种现象命名为”LLM 强化学习中的马太效应”(The Matthew Effect),即 RL 的收益与模型初始能力成正比,富者愈富。
团队在 Deepcoder、DeepSWE 的代码与 Agent 评测日志中也观察到类似规律。进一步实验用 Qwen 2.5 0.5B Instruct 在 GSM8k platinum 上跑 GRPO,发现更小的采样数 k=4 在解难题上反而优于 k=32,且在约 200 步后反超。
为什么重要
它直接质疑了当前 RL 评测的可信度:一条整体上扬的曲线,可能掩盖了模型在最难任务上毫无进展的事实。对投入大量算力做 RL 后训练的团队来说,这意味着预算可能被”刷简单题”消耗掉。同时,它把 GRPO 等方法的已知问题——全对或全错样本不产生梯度(即 signal loss)——从技术细节上升为系统偏差,影响对模型真实能力的判断。
对用户/开发者/创作者的影响
开发者选模型时,不应只看厂商给出的聚合 benchmark 分数,尤其当评测集较小(如 30 题)时,平均值容易失真。做 RL 微调的团队需要按难度分层看增益,而不是只看整体曲线;单纯调大 k 未必划算,可能同时提高在简单题上采到”罕见错误解”的概率,反而稀释难题的训练信号。使用开源 RL 模型(如 Olmo 3.1、DeepSWE 系列)的用户,也应对其”难题能力”保持谨慎预期。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
一是”Never Give Up”方法的具体实现与开源代码(作者提到有 GitHub 仓库)能否在更多模型、更多任务上复现效果;二是该方法与课程学习、特权信息等路线的组合效果;三是主流开源模型后续是否会公开按难度分层的评测结果,而非只报平均值。目前公开信息显示,相关结论主要基于数学与代码类基准,更广泛任务上的适用性仍待验证。
来源:Hacker News


