微软开源的 SkillOpt 彻底把 Agent 技能优化做成了“神经网络训练”!无需改动底层大模型权重,就能在纯文本空间实现严格、可复现的技能自我进化。🔥 以往 Agent 的 Prompt 或 Skill 要么靠人工反复试错微调,要么靠模型一次性生成或松散的自我修改,极易出现提示词退化。SkillOpt 则将自然语言技能文档视为可训练状态,用优化器严谨迭代: 深度学习训练范式:引入了 Epoch、Batch Size、文本学习率(…

微软开源了 SkillOpt,把 Agent 的自然语言技能文档当成"可训练参数",用类似神经网络的优化流程迭代提示词,无需改动基座模型权重,就能让技能文档稳定变好。这给提示词工程提供了一条可复现、可验证的工程化路径。

一句话看懂:微软开源了 SkillOpt,把 Agent 的自然语言技能文档当成”可训练参数”,用类似神经网络的优化流程迭代提示词,无需改动基座模型权重,就能让技能文档稳定变好。这给提示词工程提供了一条可复现、可验证的工程化路径。

事件核心:发生了什么

微软开源了名为 SkillOpt 的项目,核心思路是把 Agent 的 Prompt 或技能文档(Skill)视为”可训练状态”,用优化器而非人工试错来完成迭代。它引入了深度学习中常见的概念:Epoch、Batch Size、文本学习率(Textual Learning-Rate Budget)以及拒绝编辑缓冲区,将带评分的执行轨迹转化为有边界的增、删、改操作。所有对技能文档的修改必须通过验证门控机制——只有在留出验证集上取得明确准确率提升才会被采纳,从机制上避免”越改越烂”的提示词退化。训练收敛后产出的是一个约 300–2,000 tokens 的 best_skill.md,直接挂载到冻结的基座模型上使用,部署阶段不增加额外模型调用。项目还提供 SkillOpt-Sleep 离线自进化流程(收集会话 → 挖掘任务 → 重放验证 → 固化入库),已接入 Claude Code、Codex、Copilot 等本地代码 Agent 工具链。据素材,在 GPT-5.5 上实测:纯 Chat 场景准确率提升 +23.5,Codex Agentic 循环内提升 +24.8,Claude Code 环境提升 +19.1。

为什么重要

提示词优化长期停留在”人工调参”阶段,缺乏可复现、可验证的标准流程,而模型一次性生成的技能又容易退化。SkillOpt 的价值在于把这一环节纳入工程化范式:用验证集作为硬门槛,用文本编辑预算约束改动幅度,让技能迭代像训练模型一样可控。同时它不动基座权重、不增加推理开销,意味着优化成果可以低成本迁移和复用,这对依赖提示词堆叠的 Agent 产品是一条更务实的技术路线。目前公开信息显示,该项目支持多种模型后端,兼容 OpenAI、Claude、Qwen、MiniMax 等。

对用户/开发者/创作者的影响

对开发者而言,这是把”写 Prompt”变成”训练技能”的工具:可以把日常会话沉淀成技能文档,通过验证门控自动筛选有效改动,减少反复手工试错;已接入 Claude Code、Codex、Copilot,意味着现有本地代码 Agent 工作流可以较低成本接入。对做智能体落地的团队,紧凑的 best_skill.md 便于版本管理、A/B 测试和跨模型迁移,技能资产不再绑死在某个模型权重上。对普通用户和创作者,短期更直接的变化是产品侧可能提供更稳定的 Agent 表现,而非需要自己动手训练。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是 SkillOpt 在真实生产环境中的收益是否与测试数据一致,尤其是长周期任务下的技能衰减问题;二是验证门控机制对验证集质量和规模的要求,数据不足时是否仍能稳定提升;三是这一范式是否会被闭源模型厂商吸收,以及 SkillOpt-Sleep 这类夜间自进化流程在企业合规与数据隐私上如何落地。

来源:@realfxw

celebrityanime
celebrityanime
文章: 25851

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注