Google 研究人员找到方法,防止自我改进的 AI Agent 记住测试内容

谷歌云 AI 研究院联合多所大学提出 RRSI 方法,让自我改进的 AI Agent 不再“背题”,在没见过的任务上最高提升 4.7 分,同时推理 token 消耗减少约 30%。

一句话看懂:谷歌云 AI 研究院联合多所大学提出 RRSI 方法,让自我改进的 AI Agent 不再“背题”,在没见过的任务上最高提升 4.7 分,同时推理 token 消耗减少约 30%。

事件核心:发生了什么

现代 AI Agent 通常不让大模型直接干活,而是把它装进一层“harness”(可理解为提示词、工具、记忆与流程逻辑组成的执行框架)。近期的 Agent 进步,很多时候来自这层框架的优化,而不是换模型。新做法是让语言模型反复重写自己的 harness,形成一种实际可用的递归自我改进。

问题也随之出现:Agent 长期在同一批测试任务上打转,会逐渐把这些题“背下来”。训练分数上去了,遇到新任务却几乎没有提升,有些方法甚至低于未优化的基线。谷歌云 AI 研究院与高校研究者提出的 RRSI,从两个环节收紧:提出改动时限制单次可捆绑的独立编辑数量,且编辑预算随轮次递减;采纳改动时由“批评者”剔除硬编码任务名、答案等作弊式修改,并要求增加算力必须换来可测的性能提升。测试覆盖编码、办公自动化和工程设计共 8 个基准,底层模型 Claude Opus 4.8 全程冻结。

为什么重要

Agent 的自我优化一旦变成“应试”,企业投入的算力和评测分数就会失真——分数涨了,真实业务却可能原地踏步。RRSI 的价值在于,它主动牺牲了一部分训练集收益,换来跨任务的泛化能力,目前公开信息显示这是对比方法中唯一在未见基准上明显高于基线的方案。它同时把推理 token 用量压低了约 30%,意味着 Agent 落地时的成本曲线可能更可控。对行业而言,这说明竞争焦点正从“换更强的模型”转向“如何设计更聪明的 harness 与优化护栏”。

对用户/开发者/创作者的影响

开发者如果正在用自动化流程调优 Agent,需要警惕评测集污染:训练任务上的漂亮成绩未必能迁移到线上。RRSI 的思路可以直接借鉴——限制每轮改动规模、拒绝针对特定基准的硬编码、要求性能增益与算力开销挂钩。另一个值得注意的结果是,用 Gemini 3.5 Flash 优化出的编码 harness,无需修改就把更弱的 Gemini 3.1 Flash Lite 准确率从 11.2 提升到 14.6 分,说明这类机制不完全依赖模型能力,中小团队也有复用空间。对使用 Agent 产品的用户来说,短期内更现实的变化是响应更省 token、在陌生任务上更少“翻车”,而非能力突变。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是 RRSI 是否会从论文走向谷歌云的产品或 API,成为 Agent 构建工具的默认能力;二是这套护栏能否扩展到多模型、多轮交互的复杂 Agent,而非仅限冻结模型的 harness;三是其他厂商和开源社区是否会跟进类似的“反过拟合”优化策略,以及第三方评测基准是否需要加入防记忆机制。

来源:The Decoder AI News

celebrityanime
celebrityanime
文章: 27448

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注