想到ACE?更少的Token就能搞定

IBM 研究团队发布 ALTK-Evolve,一种让 AI 智能体从自身历史轨迹中学习经验的记忆系统,在相同任务上以最高约七分之一的 token 消耗,达到或超越类似方案 ACE 的准确率——这直接关系到企业部署 AI 智能体的推理成本。

一句话看懂:IBM 研究团队发布 ALTK-Evolve,一种让 AI 智能体从自身历史轨迹中学习经验的记忆系统,在相同任务上以最高约七分之一的 token 消耗,达到或超越类似方案 ACE 的准确率——这直接关系到企业部署 AI 智能体的推理成本。

事件核心:发生了什么

8 月 11 日,IBM Research 在 Hugging Face Blog 发表文章,介绍其智能体记忆系统 ALTK-Evolve,并与 OpenAI 等团队提出的 ACE(Agentic Context Engineering)进行了直接对比。两者本质相同:都让 LLM 智能体从自己的历史操作轨迹中提取可复用的经验,在推理时注入回上下文,无需更新模型权重,也不需要人工标注。

关键区别在“交付方式”。ACE 把学到的所有经验整理成一份完整 playbook,在每一步推理中都全量注入;ALTK-Evolve 则将经验聚合成带支持计数的独立指引,按任务需求动态挑选少量相关项注入。在 AppWorld 基准上,使用同一个 ReAct 基础智能体时,ALTK-Evolve 在 DeepSeek-V3.2 上达到 89.3% 的总体准确率,token 消耗为 263K,而 ACE 为 80.4% 和 634K;在 gpt-oss-120b 上,ALTK-Evolve 以 56.0% 对 54.8% 基本持平,token 消耗却只有 116K,约为 ACE 的七分之一。

为什么重要

当前 AI 智能体的商业化瓶颈之一是 token 成本。模型在完成多步骤任务时,每一步都要重新读取全部指令和上下文,次数越多,开销越大。ACE 的方案虽然有效,但它全量注入的设计本质上是“用更多 token 换更高质量”。ALTK-Evolve 证明了另一条路线:经验不是越多越好,而是“够用就好”——根据任务动态检索少量高相关指引,可以大幅削减推理成本,同时保持甚至提升准确率。这项研究把竞争焦点从“模型能力”转向了“上下文工程的效率”,对于依赖 API 调用做 AI 智能体的开发者和企业来说,这个方向可能比换更强模型更直接地影响利润和产品体验。IBM 强调双方在不压缩经验这一点上观点一致——都认为应该保留细节而拒绝概括,但在“如何交给模型”上,效率差距立现。

对用户/开发者/创作者的影响

对开发者而言,ALTK-Evolve 的设计提供了一种更省 token 的智能体记忆实现参考:支持计数、聚类合并、按子任务粒度存储经验,这些思路可以复用到自建智能体系统中。对企业决策者来说,若未来相关服务开放或集成到平台,意味着同样的任务处理量下推理成本可能下降数倍,对 AI 客服、自动化运营、数据分析等高频调用场景尤其敏感。目前公开信息显示该项目为 IBM 研究发布,尚未提及商用产品计划。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

值得观察三点:一是 ALTK-Evolve 是否会开放源代码或接入 IBM watsonx 等企业级平台;二是 ACE 团队是否会调整策略,转向按需注入,跟进效率维度;三是这类记忆系统在不同基座模型之间的迁移效果是否稳定,毕竟 gpt-oss-120b 上的准确率差距已经很小,更强的模型容错空间也更窄。

来源:Hugging Face Blog

celebrityanime
celebrityanime
文章: 18306

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注