WikiSkill:把 Agent 的经验沉淀为持久知识,让 Skills 持续进化 来自 Google Research 的论文,在 “Agent Skills 自动进化” 这一方向上,论文提出在原始经验与可执行 Skills 之间插入一个持久化知识层(Wiki),让经验被持续编译、沉淀为结构化知识,从而支撑 Skills 的长期、复利式进化——实验表明这一改动带来了一致且显著的性能提升。 https://t.co/m79jmZOl…

Google Research 提出 WikiSkill 框架,在 Agent 经验与可执行 Skills 之间插入一个持久化知识层(Wiki),让经验能持续沉淀、复利进化,并在 5 个基准、5 个模型上显著超越现有方法。

一句话看懂:Google Research 提出 WikiSkill 框架,在 Agent 经验与可执行 Skills 之间插入一个持久化知识层(Wiki),让经验能持续沉淀、复利进化,并在 5 个基准、5 个模型上显著超越现有方法。

事件核心:发生了什么

来自 Google Research 的论文《WikiSkill》针对”Agent Skills 自动进化”这一方向提出结构性改进。当前主流方法(如 EvoSkill、Trace2Skill、SkillOpt)已能自动从执行轨迹中提取 Skills,但存在一个共同缺陷:经验是”用过即散”的,每轮迭代中学到的洞察散落在提案历史、反馈记录等临时产物中,无法被系统性地复用到后续迭代。

WikiSkill 的解决方案是在原始经验与可执行 Skills 之间加入一个三层知识架构:Raw Layer 存放完整执行轨迹,Wiki Layer 维护模式页、演化日志和 Skills 影响追踪表,Skill Layer 存放可执行的 SKILL.md 文件。每轮迭代由四个角色协作完成:推理 Agent 运行 rollout(刻意禁止访问 Wiki 以保持轨迹纯净)、Wiki 维护者做根因分析、Skills 提案者基于 Wiki 提出原子化修改、门控机制在验证集上评测并决定接受或回滚。

实验覆盖 5 个基准(LiveMath、SealQA、SpreadsheetBench、OfficeQA、ALFWorld)× 5 个模型(Qwen 4B/9B/27B、Gemma-4-31B、Gemini-3.5-Flash),所有设置均跑 3 次独立实验并做 bootstrap 显著性检验。结果显示 WikiSkill 在所有模型上取得最高平均分,比最强基线高 3.3–12.0 分,且优势”更强且更稳”——部分基线(如 EvoSkill 让 Gemma 在 LiveMath 上从 33.9% 降至 29.8%)反而损害性能。

为什么重要

这项工作的核心意义在于把”经验管理”从临时产物提升为持久资产。当前 Agent 生态中,Skills 的自动进化大多依赖每轮迭代的即时反馈,缺乏一个客观、可追溯、不断累积的知识表示。WikiSkill 通过 skill-impact.md 程序化记录每次提案的 diff、验证分数和接受/拒绝结果,形成一条可审计的轨迹,避免后续提案重复已被否决的修改。

实验还揭示了一个关键区分:”发现有用程序知识”与”执行这些知识”是两种独立能力。Skills 可以跨模型迁移,例如 Qwen-9B 用 27B 进化出的 Skills 在 ALFWorld 上达 70.2%,高于用自己的 Skills(63.4%)。但迁移也有陷阱:小模型 Skills 中”低级变通”(如单行 Python 命令)可能束缚强模型,造成负迁移。这提示行业,Skill 的质量与模型规模是正交的两个优化维度。

另一个值得注意的消融发现:给提案者访问 Wiki 使平均分从 48.7% 升至 63.7%(+15),但若让推理 Agent 在训练时也能看 Wiki,分数反而降至 60.9%——因为轨迹的知识来源被”污染”,降低了其对 Skills 开发的诊断价值。这个设计取舍对 Agent 训练流程有直接参考意义。

对用户/开发者/创作者的影响

对正在构建 Agent 工作流的开发者而言,WikiSkill 提供了一个可落地的架构参考:与其让 Skills 在每轮迭代中随意漂移,不如引入一个独立维护的知识层,让每次经验都沉淀为可检索的结构化记录。对于使用 Qwen、Gemma 等开源模型的团队,论文数据显示 Skills 进化能在一定程度上”替代”模型规模——9B + Skills(47.4%)可超过无 Skills 的 27B(39.4%),这对算力有限的中小团队是直接的降本信号。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对内容创作者和 Prompt 工程师,该框架的”影响追踪表”思路也通用:任何需要反复迭代的指令集或工作流模板,都值得建立一个可回溯的变更日志,记录每次改动的动机和效果,而非依赖直觉或记忆。

值得关注的后续

目前公开信息显示这是 arXiv 预印本论文,尚未看到 Google 发布官方代码或产品化计划。值得关注的观察点包括:第一,WikiSkill 是否会开源实现,以及能否与现有 Agent 框架(如 LangChain、AutoGPT)直接集成;第二,该框架在更长周期(数十轮迭代)下的复利效应是否可持续,还是会出现知识库膨胀导致检索效率下降;第三,跨模型迁移的负迁移问题是否有更系统的规避策略,这将影响 Skills 作为可交易资产的生态能否形成。

来源:@shao__meng

celebrityanime
celebrityanime
文章: 21235

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注