一句话看懂:知名终端工具 Warp 在 Claude 上构建了一套“自我改进型 Agent”,通过自动收集人类工程师在代码评审中的反馈来持续更新 Skill,解决了 Agent 缺乏项目记忆和团队规范的核心痛点。
事件核心:发生了什么
Claude 官方博客近日发布文章《How Warp builds self-improving agents on Claude》,详细介绍了 Warp 团队如何用 Claude 构建具备自我进化能力的代码审查 Agent。早期尝试并不顺利:Agent 不了解项目背景、不熟悉团队规范,也无法记住历史经验教训,人工指出的问题下次依然会犯。
Warp 的解决方案并不依赖模型自我反思,而是设计了两套 Skill 协作:一套基础 Skill 负责执行代码审查,另一套改进 Skill 定期收集人类工程师在 PR 下留下的评论(尤其是对 Agent 审查结果的反馈),再据此自动更新审查 Skill。整个流程无需人工整理评论或填写问卷,人类只需自然地写代码评审意见,后续改进由 Agent 自动完成。
值得一提的是,该文章使用了 AGENTS.md 而不是 Claude 默认支持的 CLAUDE.md,这一细节在开发者社区引发了讨论。
为什么重要
Warp 的实践为“Agent 如何持续进化”提供了一个可落地的参考范式:不是让模型自己改自己,而是让 Agent 根据人类对模型输出的标注——在这里是代码评审意见——去迭代技能。这种“人负责高维度判断,Agent 负责执行与改进”的分工,可能比单纯依赖模型自我反思更稳定、更可控。
另一个关键洞察是低摩擦设计。反馈收集被嵌入开发者已有的工作流(写 PR 评论),不增加额外提交负担。如果反馈流程繁琐,信号就会枯竭,Skill 也就无法持续改进。Warp 还建立了安全机制:Agent 不会盲目接受所有反馈,会进行合理性检查,限制有权影响 Skill 更新的人员范围,并保留人工审核环节。对于有明确标准答案的领域(如测试是否通过)可以建立验证基准,而对于代码风格这类主观领域,则依赖领域专家判断而非开放给所有人随意反馈。
对用户/开发者/创作者的影响
对于开发者来说,这套机制意味着 AI 代码审查工具不再是一次性的静态规则匹配,而是能根据团队实际反馈持续变好。对于正在构建 Agent 应用的团队,Warp 总结的实践原则有直接参考价值:写原则而非死规则,解释规则背后的“为什么”,保持 Skill 精简并使用渐进式披露,反馈质量大于数量但数量也有帮助,以及把“改进 Skill 的 Skill”做成通用机制以复用到其他领域。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
来自中文社区的实践也印证了这个方向。有开发者分享了自己编写的 JS 反编译 Skill,Agent 遇到新场景并解决后会自动更新自身 Skill,效果不错,但 Skill 文件会越来越大;而写作类自我进化 Skill 则因缺乏统一标准,经常出现负优化。这说明 Skill 进化的关键在于是否有清晰可判别的反馈信号。
值得关注的后续
目前公开信息显示,Warp 的这套自我改进机制仍处于内部实践阶段。后续值得观察三点:其一,Warp 是否会将该能力产品化,开放给所有终端用户使用;其二,AGENTS.md 与 CLAUDE.md 的兼容性问题是否会促使 Anthropic 官方统一标准;其三,这种“基于人类反馈改进 Skill”的模式能否被复制到代码审查之外的更多场景,例如文档写作、数据分析或客服自动化,尤其是在缺乏明确标准答案的领域如何控制改进质量。
来源:@dotey


