推理模型自我进化为何崩塌?R-Quest用有效性与新颖性反馈稳住十轮训练

一篇发布在 Hugging Face Papers 的论文摘要指出,自我进化推理模型会因自生成问题中无效题和重复变体增多而性能崩塌,作者提出 R-Quest 方法,用问题有效性与新颖性反馈来维持多轮自我训练。

一句话看懂:一篇发布在 Hugging Face Papers 的论文摘要指出,自我进化推理模型会因自生成问题中无效题和重复变体增多而性能崩塌,作者提出 R-Quest 方法,用问题有效性与新颖性反馈来维持多轮自我训练。

事件核心:发生了什么

根据 2026 年 10 月 3 日 Hugging Face Papers 收录的论文摘要,研究者分析了自我进化推理模型在多轮自训练中性能持续下滑的原因。问题出在模型自己生成的问题上:一方面,无效问题随训练轮次增加而变多,而基于答案一致性的过滤反而进一步提高了它们在训练数据中的比例;另一方面,现有基于词汇相似度的问题多样性控制,无法识别表述不同但数学上等价的问题,导致后期训练中问题多样性崩塌。

作者提出 R-Quest:先训练求解器识别并拒绝无效问题,再用它的判断来引导提问器奖励并过滤求解器训练数据;同时用冻结的基础模型比较采样问题对,提供新颖性反馈以避免重复。摘要称,在两个模型家族、12 个基准上,R-Quest 在数学推理、通用领域推理和代码生成任务中取得最高平均表现,并在十轮自我进化中保持稳定增益,最终轮达到峰值,比 R-Zero 高出 17.32 分。需要说明的是,以上均为论文摘要中的说法,目前公开信息显示尚未核验全文实验,也不代表已上线产品或经过同行评审。

为什么重要

自我进化是推理模型降低数据标注成本、持续提升能力的一条重要技术路线,但此前不少工作只关注如何生成更多问题,对生成数据的“质量退化”缺少系统约束。这篇论文把问题定位到两个具体环节:无效问题和数学等价重复,并给出可操作的反馈信号,这为训练流程提供了更细的改进方向。如果同类方法能在开源和闭源大模型上复现,可能影响未来推理模型后训练的策略选择,减少无效算力消耗。

对用户/开发者/创作者的影响

对开发者而言,R-Quest 的思路提示在构建自训练流水线时,不能只依赖答案一致性或词汇相似度来筛选数据,需要引入有效性判断和语义层面的新颖性比较;如果后续有开源实现,可能降低训练多轮自我进化模型的门槛。对使用推理模型 API 的产品团队来说,短期影响有限,因为论文摘要不等于可用功能,但可以关注模型厂商是否在后训练环节采用类似反馈机制。对内容创作者和企业采购者,真正有价值的是模型在多轮迭代后是否还能保持稳定输出,而不是单轮评测的峰值。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是论文是否公开完整实验细节、代码和模型权重,供社区复现;二是 R-Quest 在更大参数模型和更多任务上的泛化能力,以及 17.32 分的优势是否可复现;三是主流推理模型厂商是否会在后训练流程中引入类似的有效性与新颖性过滤,进而影响模型迭代速度和推理成本。

来源:Hugging Face Papers

celebrityanime
celebrityanime
文章: 28095

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注