智能体跑长任务为何”失忆跑题”:AWS、Claude Code、Manus 们用四套框架机制给出答案

AI 智能体跑长任务时频繁“失忆跑题”,问题往往不在大模型本身,而在包裹模型的执行框架。AWS、Claude Code、Manus、OpenAI Codex、Amazon Bedrock AgentCore 等正用四套机制把“浅层循环”改造成能处理长任务的深智能体。

一句话看懂:AI 智能体跑长任务时频繁“失忆跑题”,问题往往不在大模型本身,而在包裹模型的执行框架。AWS、Claude Code、Manus、OpenAI Codex、Amazon Bedrock AgentCore 等正用四套机制把“浅层循环”改造成能处理长任务的深智能体。

事件核心:发生了什么

一份梳理多个主流框架的研究指出,LangChain Deep Agents、Claude Code、Manus、OpenAI Codex 和 Amazon Bedrock AgentCore 都在围绕四个“引擎”做工程化设计。AWS 自研的云编程智能体设计指南把问题说得很直接:浅层智能体在长周期任务中会遭遇上下文溢出、注意力被带偏、状态无法保持。

第一个引擎是上下文预算与卸载。Deep Agents 内置硬规则:工具返回超过 20000 tokens 就写入文件系统,只留路径和前 10 行预览;会话上下文超过窗口 85% 时,旧的编辑调用被截断为指针。Claude Code 在加载前就把记忆限制在 200 行或 25KB。AWS AgentCore 则让协调者并行启动三个浏览器子智能体,各自跑在独立 MicroVM 中,分析子智能体只接收结构化结果,预期耗时 4 到 6 分钟。

其余三个引擎分别是:逼近上限时压缩对话、用 todo 清单“复述”目标、跨会话记忆。值得注意的是,Chroma 的 Context Rot 报告评估了 18 个大模型后发现,输入越长模型越不可靠;Anthropic 解释注意力机制会为 n 个 token 生成 n² 配对关系,上下文是递减资源而非无限桶。Manus 也透露,典型任务约调用工具 50 次,输入输出比接近 100:1。

为什么重要

这指向一个被低估的事实:单纯扩大上下文窗口解决不了长任务稳定性。目前公开信息显示,压缩已下沉到 API 层——OpenAI Responses API 通过 `compact_threshold` 提供服务端压缩,Codex 依赖它处理长编程任务;Claude 平台也提供可自定义的压缩编辑选项。这意味着“harness”正成为模型能力之外的独立竞争维度,谁能管好模型之外的一切,谁就能让同样的模型跑得更远。

对用户/开发者/创作者的影响

对开发者而言,框架选型不再只看模型跑分,而要看上下文卸载、压缩策略、状态管理和跨会话记忆的实现质量。Deep Agents 在 2026 年 7 月发布的 0.7 版本把 todo 中间件改为可选,因为评测显示关闭后奖励略升、成本下降;LangChain 仍建议长任务、弱模型和需要进度展示的界面重新开启它。对企业和创作者,ETH Zurich 的研究提供了冷静参照:AGENTS.md 这类上下文文件通常不提升成功率,反而让推理成本增加 20% 到 23%,每次重载都是对注意力预算的固定征税。Claude Code 因此建议把 CLAUDE.md 控制在 200 行以内。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

其一,四套引擎的工程实践是否会沉淀为行业通用标准或开源中间件;其二,API 级压缩与记忆能力的定价和调用成本是否变化;其三,框架是否把“强制压缩测试”纳入常规验证——最危险的失败是智能体总结后立刻要求澄清,或错误宣布任务完成。这些问题目前尚无统一答案。

来源:AIbase

celebrityanime
celebrityanime
文章: 23311

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注