谷歌开源RRSI:让AI Agent自我改进又不跑偏的工程方法

谷歌研究把 RRSI(正则化递归自我改进)的“该保留哪些自我修改”这部分规则开源成纯 Python 代码,让 LLM Agent 可以在模型冻结的前提下重写自己的提示词、工具与流程,同时用统计校准和正则化机制防止过拟合。它不依赖 API Key 或 GPU,普通开发者也能本地跑通。

一句话看懂:谷歌研究把 RRSI(正则化递归自我改进)的“该保留哪些自我修改”这部分规则开源成纯 Python 代码,让 LLM Agent 可以在模型冻结的前提下重写自己的提示词、工具与流程,同时用统计校准和正则化机制防止过拟合。它不依赖 API Key 或 GPU,普通开发者也能本地跑通。

事件核心:发生了什么

MarkTechPost 于 2026 年 10 月 8 日发布一篇教程,解读 Google Research 的 RRSI 方法。这套方法的核心是:模型本身不动,让 Agent 围绕它不断改写自己的“外壳”——包括 prompt、工具集、记忆、控制流和子 Agent 结构。难点在于,外壳很容易在反复自我修改中过拟合于它进化时遇到的那些任务。

RRSI 完整闭环原本要用 Claude Opus 在 Vertex AI 上起草编辑方案,并在 Docker 里跑基准测试,这套配置免费环境跑不动。但教程指出,真正承载论文思想的部分——决定“哪些编辑保留、哪些丢弃”的选择算法——是纯 Python 实现,不需要 API Key、GPU 或数据集下载。开发者可以直接从 google-research 仓库安装,按固定 commit 使用,包本身只依赖 Anthropic 客户端。

教程把论文符号和代码函数一一对应:分数与成本估计在 evaluate,噪声带在 calibrate,选择算法在 selection,退火编辑预算在 schedule,泄漏筛查在 critic,编辑历史与收获、剪枝、停滞、探索指标在 history。默认超参包括 T 轮、每任务 k 次试验、每轮 m 个候选、编辑预算在 b_min 到 b_max 之间,以及一套权重与阈值参数。

为什么重要

Agent 自我进化是 2026 年最热的研究方向之一,但“越自我改进越偏”是共同难题。RRSI 把问题拆成两层:模型冻结保证能力基线不漂移,正则化选择机制则决定每次编辑是否真的带来可泛化的收益,而不是在训练任务上刷分。这种设计让自我改进从概念验证更接近可复现的工程方法。

更实际的一点是,谷歌把最关键的选择逻辑用纯 Python 开源,而不是锁在托管服务里。这降低了研究门槛,也让更多团队能在自己环境中审计、复现和对比不同策略。对闭源大模型厂商而言,这相当于把 Agent 的“进化控制器”开放出来,可能影响未来 Agent 框架的竞争点:谁的选择机制更稳、更省算力,而不只是谁的模型更强。

对用户/开发者/创作者的影响

开发者现在可以在本地安装 RRSI 包,接上自己模拟的 domain 来测试编辑保留规则,不需要调用付费 API 或准备 Docker 基准环境。教程还建议把模拟 Agent 接入 RRSI 自己的 Domain 接口,用已知真实效果的模拟环境来审计 RRSI 的决策,并与“哪个分数高就留哪个”的朴素搜索做对照。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对做 AI 应用的团队,这提供了两条参考:一是提示词、工具和记忆的自动优化可以工程化,不必全靠人工试错;二是自动优化必须配正则护栏,否则越优化越窄。创作者和产品侧短期内不会直接看到功能变化,但目前公开信息显示,这套代码更多是研究工具,不是已上线的托管产品。是否值得投入,取决于团队能否复现其基准并适配自己的业务任务。

值得关注的后续

一是 RRSI 是否会被更多 Agent 框架集成,或者出现第三方复现与独立评测;二是谷歌是否会把完整闭环——包括 Vertex AI 上的编辑起草和 Docker 评测——做成托管服务;三是选择算法在更复杂、更真实的任务集上能否保持稳定,避免只在教程中的模拟环境里有效。目前信息来自 MarkTechPost 的教程解读,论文本身的实验细节和同行评审状态尚未在素材中体现。

来源:MarkTechPost Research

celebrityanime
celebrityanime
文章: 28587

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注