Claude Code 通过对话而非保存的记忆实现自我改进

Anthropic 的 Claude Code 在模拟业务工作流中实现了自我改进,保留任务成功率从 34% 提升到 44%。但实验证明,驱动改进的不是记忆文件,而是对话上下文本身。

一句话看懂:Anthropic 的 Claude Code 在模拟业务工作流中实现了自我改进,保留任务成功率从 34% 提升到 44%。但实验证明,驱动改进的不是记忆文件,而是对话上下文本身。

事件核心:发生了什么

2026 年 8 月 6 日,开发者 Andrew Jesson 发布博客,公布了一项针对 Claude Code(运行 Opus 5 模型、xhigh effort 模式)的自我改进实验。研究者搭建了一个模拟业务工作流服务器,通过 MCP server 向 Claude Code 持续推送任务,任务类型涵盖电子表格、CRM 记录、邮件和工单处理。Claude Code 需要调用 get_task 拉取任务,使用已有工具完成,再通过 done 提交评分,直到任务流耗尽。

实验中有两个关键发现。第一,Claude Code 在 84 次写入/编辑中全部操作的是记忆文件,从未自己写代码、生成子代理或检索网页,最终形成了一个有向知识库。第二,与直觉相反,移除记忆文件后,保留任务成功率几乎不受影响;真正带来提升的是对话上下文,即任务执行轨迹和压缩后的摘要。数据显示:完整对话上下文让任务解决率提升 9.9 个百分点(95% 置信区间 [5.9, 13.8]),去掉记忆文件后仍有 8.8 个百分点;仅保留压缩摘要为 5.4 个百分点;而单独使用记忆文件只有 1.7 个百分点,统计上不显著。

为什么重要

这一结果挑战了“长期记忆是 Agent 自我改进核心”的常见假设。它表明,模型在单个会话内通过对话历史、执行反馈和结果摘要就能获得可衡量的能力提升,不需要额外构建复杂的持久化记忆系统。对 AI Agent 的设计路线有直接影响:对话轨迹本身就是高质量的训练信号,而记忆文件可能更适合承担知识组织功能,而非性能提升引擎。

对用户/开发者/创作者的影响

对使用 Claude Code 的开发者来说,最实际的启示是保持连贯的对话会话比频繁清理上下文、或过度依赖记忆笔记更有效。压缩摘要(compaction summary)在实验中表现突出,说明大模型产品对长会话的摘要管理值得更多关注。对 Agent 开发者而言,这个实验也提供了一个

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

celebrityanime
celebrityanime
文章: 18313

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注