arXiv新论文提出可逆式上下文遗忘:工具型AI代理省一半输入Token

一篇 arXiv 新论文提出让 AI 代理自己“遗忘”旧工具结果、只留简短笔记并把原文存档,在实验性调试任务中把累计输入 Token 减少约 50%,但换来了更多请求和 17% 的时间开销。

一句话看懂:一篇 arXiv 新论文提出让 AI 代理自己“遗忘”旧工具结果、只留简短笔记并把原文存档,在实验性调试任务中把累计输入 Token 减少约 50%,但换来了更多请求和 17% 的时间开销。

事件核心:发生了什么

2026 年 10 月 9 日,arXiv cs.AI 收录了一篇题为“Agent-Controlled Forgetting for Tool-Using Agents”的论文摘要,讨论工具型 AI 代理的上下文管理问题。作者提出的做法是:由正在执行任务的模型自行挑选之前观察到的工具返回结果,用一条短笔记替换原始内容,同时把完整原文放进一个可恢复的存档。一个 Python 测试框架负责批量归档和显式恢复,不需要针对任务做专门的模型训练,并且会保护用户指令和助手消息不被改写。

在摘要给出的探索性案例中——先是 OpenTelemetry 调试,随后接一个无关的实现任务——该方法结束时供应商报告的 prompt token 为 231,951,而保留完整历史的一侧为 912,492,累计输入 token 少用了 50%,估计 API 成本为 1.28 至 1.44 美元,对照组约为 4.38 美元。两组都通过了两个案例的主要行为测试,但都没有完全满足后续评估;该方法发出的请求更多,耗时也多出 17%。另有一对应用开发任务没有带来上下文或成本节省,更早的一次延续任务虽然上下文减少,人工评估的质量反而更低。

为什么重要

工具型代理的痛点之一是:每一次搜索、每一次代码执行、每一次 API 调用都会把冗长的原始输出塞进上下文,而这些内容里真正有用的可能只有几行。上下文越长,推理成本越高,模型被无关信息干扰的概率也越大。这篇论文把“遗忘”从被动截断变成代理主动选择、可恢复的整理动作,并明确把“工作负载依赖”作为一个核心结论。也就是说,可逆式上下文管理不是万能的省钱开关,它在噪声大、工具调用密集的轨迹里可能有效,在结构化、紧凑的任务里未必划算。这对当前围绕大模型推理成本、长上下文窗口和 AI 应用商业化的竞争具有参考价值。

对用户/开发者/创作者的影响

对开发者而言,如果后续有开源实现或框架集成,可以重点关注它是否能接入现有 Agent 工作流,比如 LangChain、OpenAI Assistants API 或自建的函数调用循环。摘要中的 harness 用 Python 编写,思路不依赖特定模型厂商,但文中未说明是否开源、是否支持多模型。对普通用户和创作者来说,这类技术短期不会直接改变产品体验,但如果被平台采用,可能表现为 AI 应用在长任务中更便宜、更稳定,而代价是偶尔需要“找回”被归档的原始工具输出。目前公开信息显示,这仍是论文摘要层面的研究,不是已上线产品功能,也没有经过同行评审。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是该方法能否在更多任务类型上复现,尤其是论文自己指出的“应用开发任务无节省”这一反例;二是恢复机制在实际使用中的可靠性和延迟成本,17% 的时间开销是否会被后续优化;三是是否有开源框架或云厂商将这种归档加恢复的上下文管理纳入 API 或 Agent 运行时。若成本优势在噪声型工具调用场景中成立,可能会影响企业采购 AI 代理时的成本测算。

来源:arXiv cs.AI

celebrityanime
celebrityanime
文章: 28548

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注