Google WikiSkill赋予AI Agents对过往错误的持久记忆,以优化未来表现

Google Research 推出 WikiSkill 框架,给 AI 代理配备一个持续累积的“经验库”,让它能把每次执行任务的成功与失败写进类似 Wiki 的知识库中,并据此优化自身行为指令,从而在不改变模型训练参数的情况下持续提升任务表现。

一句话看懂:Google Research 推出 WikiSkill 框架,给 AI 代理配备一个持续累积的“经验库”,让它能把每次执行任务的成功与失败写进类似 Wiki 的知识库中,并据此优化自身行为指令,从而在不改变模型训练参数的情况下持续提升任务表现。

事件核心:发生了什么

Google Research 的研究者提出了 WikiSkill,一个为 AI 代理(Agent)设计的三层工作框架。底层是“原始层”,存储完整的执行轨迹;中层是“Wiki 层”,从轨迹中提炼出失败模式与成功策略,这一层会持续累积、永不重置;顶层是“技能层”,存放代理实际使用的程序化指令模块。每次任务完成后,系统会通过“Wiki 维护者”分析轨迹,再由“技能提议者”提出指令修改,最后用验证集测试改动是否有效,如果无效则回滚技能,但 Wiki 中的失败记录会被保留供后续迭代参考。

测试显示,这套方法在数学推理、表格处理、网页搜索、文档问答和虚拟环境交互五类基准上均优于现有方案。以 Gemini-3.5-Flash 为例,平均准确率从 49.5% 提升到 68.1%;在单项测试中,该模型在 LiveMath 上从 33.0% 跃升至 72.6%。由于模型本身不会持续学习,WikiSkill 本质上是通过让模型在每次运行后写出更好的“自我指令”来实现改进,属于一种有效的工程绕行方案。该研究还引用了 Andrej Karpathy 关于“LLM Wiki”的设想,即将经验编译为持续累积的知识。

为什么重要

当前的 AI 代理普遍面临“一次性”问题——每次任务结束后,模型不会保留任何执行经验,这在算力使用和任务效率上是巨大的浪费。WikiSkill 提供了一条不依赖模型权重更新的路径,用外部知识库模拟持续学习,避开了“模型终身学习”这一尚未解决的研究难题。这种做法对整个行业具有参考价值:它意味着代理的能力提升可以不依赖重新训练或微调,而是通过外围系统的自我迭代实现,这在一定程度上绕开了闭源模型权重不可修改的限制,也为小型开发团队提供了在现有模型基础上构建“会成长”的代理的可能性。

值得注意的是,测试中较小的模型(如 Qwen-3.5-4B)在执行复杂的长上下文任务时仍存在稳定性问题,而大模型从技能演化中获益更明显。这一结果提示,WikiSkill 当前更像是对大模型能力的“放大器”,而非替代品。

对用户/开发者/创作者的影响

对开发者而言,WikiSkill 的吸引力在于其技能模块具有可移植性——研究显示一个模型生成的技能可以被另一个模型接收使用,有时效果甚至优于接收模型自行生成的技能。这意味着开发者社区可以共享、交易和复用“技能包”,降低代理应用的开发门槛。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对使用 AI 代理处理重复性工作流的用户,这类框架能够减少反复纠正同一类错误的情况——代理会记住上次哪里做错了,并在下次尝试时主动规避。不过,当前公开信息显示 WikiSkill 仍是研究项目,尚未以产品形态上线;其技能回滚机制也需要额外的验证算力投入,实际部署成本目前没有公开数据。

值得关注的后续

第一,Google 是否会将该框架整合进 Vertex AI 或 Gemini 生态的相关产品线,形成商业化的代理开发工具;第二,技能在不同模型之间的转移可靠性尚不稳定,如果这类“技能市场”出现,跨模型验证标准是否会建立;第三,Wiki 层持续膨胀之后的维护成本和检索效率问题——当经验库积累到一定规模,如何保证代理能快速找到最相关的历史教训,将是该技术能否从实验室走向生产的另一个关键变量。

来源:The Decoder AI News

celebrityanime
celebrityanime
文章: 21330

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注