SkillScriptBench 发布:350 项任务评测 Agent 技能包自进化

arXiv 新论文提出 SkillScriptBench,用 350 项任务把 Agent 技能包修订拆成文档修复、脚本修复与行为保持三类能力,并发现多模型下仅编辑 Markdown 并不总输给同时改脚本的方法。

一句话看懂:arXiv 新论文提出 SkillScriptBench,用 350 项任务把 Agent 技能包修订拆成文档修复、脚本修复与行为保持三类能力,并发现多模型下仅编辑 Markdown 并不总输给同时改脚本的方法。

事件核心:发生了什么

2026 年 10 月 7 日发布于 arXiv cs.AI 的论文摘要显示,研究者提出 SkillScriptBench,用于评测可执行 Agent 技能包在自进化过程中的修复能力。这类技能包把自然语言指令和可执行脚本打包成可复用模块,修订时既要修错,也不能破坏原本正确的行为。

该基准包含 350 项任务:从超过 35,000 个 GitHub 托管的 Skill 根目录中筛选 100 个包,构建 150 项修复任务,每项任务给包注入脚本缺陷,并附带维护请求和可执行行为检查。另有 200 项受控任务来自 50 个包,同一维护请求在干净、文档缺陷、脚本缺陷、两者兼有四种状态下分别评测。论文还提出 AST-Guided Skill Revision,用抽象语法树和调用关系定位维护需求对应的代码位置,限制脚本编辑范围并同步更新文档。摘要称,跨模型平均,该方法在修复成功率的绝对提升为 Raw Package 21.9%、CoEvoSkills 27.7%;三次运行全部解出的任务占比绝对提升分别为 20.8% 和 31.5%。

为什么重要

过去不少 Agent 技能评测偏重文档式提示词修改,容易把“改说明”和“改代码”混在一起看。SkillScriptBench 的价值在于把文档修复、脚本修复和保持行为分开度量,让开发者能判断一个 Agent 是真的会修程序,还是只擅长改 Markdown。论文摘要同时传递出一个反直觉信号:在它设定的条件下,同时编辑文档和脚本的方法能修复脚本缺陷,但在文档修复或行为保持上并未持续优于纯 Markdown 修订。目前公开信息显示,这仍是一篇 arXiv 预印本,尚未说明是否经过同行评审或已落地为产品。

对用户/开发者/创作者的影响

对开发者而言,如果未来把这类基准用于 Agent 技能市场或开源 Skill 仓库,评估重点可能从“说明写得全不全”转向“改动后脚本还能不能跑、原有行为有没有被破坏”。对使用 Agent 工作流的团队,选型时可以多问一句:技能包更新是只改提示词,还是会动代码,以及有没有可执行检查来兜底。对创作者来说,发布包含脚本的 Skill 时,维护请求、测试用例和调用关系可能变成新的交付标配。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是 SkillScriptBench 是否会公开完整任务、注入缺陷方式和执行检查,供社区复现;二是 AST-Guided Skill Revision 能否在更多模型和真实仓库中保持优势;三是这类评测会不会被 Agent 平台、Skill 市场或开源社区纳入技能包上架与更新流程。

来源:arXiv cs.AI

celebrityanime
celebrityanime
文章: 27842

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注