Google DeepMind 的 Dream-RSI 通过让 AI Agent“做梦”回顾过去的尝试来帮助其改进

Google 与 DeepMind 提出 Dream-RSI,让 AI Agent 复用已完成的搜索记录来"演练"新策略,无需重跑昂贵的模型推理和评估,就能在下一轮实际搜索中用上更好的策略。

一句话看懂:Google 与 DeepMind 提出 Dream-RSI,让 AI Agent 复用已完成的搜索记录来”演练”新策略,无需重跑昂贵的模型推理和评估,就能在下一轮实际搜索中用上更好的策略。

事件核心:发生了什么

据 The Decoder 2026 年 9 月报道,Google 和 DeepMind 的研究团队提出了一种名为 Dream-RSI 的方法,用来改善 AI Agent 在复杂搜索任务中的”探索”决策。它的做法是:Agent 在搜索过程中把每次尝试及其结果记录成搜索树,之后不再发起真实推理,而是直接在这棵已记录的树上回放不同选择——比如”如果当时先试另一条路会怎样”,从而测试成千上万种替代策略。团队把这一步称为”做梦”(dreaming)。

关键在于,Dream-RSI 改的是搜索策略,而不是底层大模型,生成方案的模型全程不动。测试使用 Gemini 3.1 Pro 和 Gemini 3.7 Flash,覆盖三个领域的八项任务。其中一项是让系统为基因组学和金融常用的统计计算写出最快程序:平均运行时间从 3587 毫秒降至 2931 毫秒,尝试次数从 550 降到 317;对比系统 SimpleTES 则需要 51200 次运行。在两个 GPU 内核任务上,Dream-RSI 在同等性能下把运行次数减少最多 2.43 倍,或在同等预算下把性能提升最多 2.09 倍。

为什么重要

自我改进型 Agent 的常见瓶颈是探索成本:策略太死板会反复撞墙,边搜边调又意味着大量重复的高成本推理。Dream-RSI 的价值在于把”试错”从真实运行搬到历史记录上,用已有结果做低成本仿真。目前公开信息显示,这套方法只优化搜索层面,不涉及模型再训练,因此更接近一种可外挂的策略学习层。对于正在做 Agent、代码生成、算法发现和 GPU 内核优化的团队,这意味着同样的算力预算可能换来更多有效尝试,也再次说明大模型竞争正从”模型本身”延伸到”如何使用模型”的推理侧工程。

对用户/开发者/创作者的影响

对开发者而言,这类思路的吸引力在于它可能以较小改造成本接入现有 Agent 框架:只要保留完整的搜索轨迹,就能离线回放并筛选策略,减少对 API 调用和评估算力的浪费。对做代码生成、自动调参、科学计算加速的团队,尝试次数下降直接对应成本下降。对企业采购方,评估 Agent 工具时可以多问一句:是否有可复用的历史轨迹和策略优化机制,而不只是看单次生成质量。对内容创作者,这一层优化目前更多影响工具背后的效率,短期不会直接改变使用体验,但可能让依赖长链推理的 AI 应用跑得更快、更便宜。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是 Dream-RSI 是否会以 API 或开源组件形式落地,让第三方 Agent 框架直接复用;二是它在更开放、结果难以自动评估的任务上是否同样有效,因为回放的前提是搜索树里已有可比较的结果;三是同类方法的跟进速度,以及它能否与现有推理优化、缓存和并行搜索方案叠加。

来源:The Decoder AI News

celebrityanime
celebrityanime
文章: 24429

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注