一句话看懂:三项独立基准测试发现,在同一模型下仅更换 AI 编程智能体框架,完成同一任务的 Token 消耗和成本可相差数十倍甚至 70 倍。模型不再是唯一的成本变量,框架本身正在成为账单差异的主要来源。
事件核心:发生了什么
InfoQ 援引三项基准测试:6 月一项测试用 Aider、Claude Code、Codex、Goose、OpenClaw 等 12 种配置,在 OpenRouter 上跑相同的 12 个 Python 任务,分别使用 DeepSeek V4 Flash 和英伟达 Nemotron 3 Ultra。结果显示,每解决一个任务消耗的 Token 从 Aider architect 模式的约 3500 个到 OpenClaw 的 29.2 万个不等。8 月 Composio 比较 8 种框架、30 个企业工作流,每次成功执行成本从 Pi Agent 的 0.028 美元到 Claude Code 的 0.195 美元。Artificial Analysis 的编码智能体指数则覆盖 326 项任务,每项运行三次取平均。
差距的核心被归因于“启动税”:框架在真正处理任务前就要发送系统提示词、工具说明和环境设置。Aider architect 模式约 700 个 Token,OpenClaw 约 2.6 万个。若持续 15 轮,仅脚手架就可能消耗约 39 万个输入 Token。两项测试中,启动税乘以轮数对 Token 用量的预测 R² 达 0.99。
为什么重要
过去企业采购 AI 编程工具时,主要盯模型和单价。这些测试表明,框架选择带来的成本差距已足以媲美模型定价差异,而通过率差距只有约 20 个百分点。更关键的是缓存:Composio 披露 Claude Code 输入 Token 仅 1.5% 来自缓存,Codex 约 70%。新输入价格约为缓存输入的五倍,导致原始 Token 更少的框架反而账单更高。缓存命中率并不只由框架决定,还与端点协议、网关和提供商路由有关。
对用户/开发者/创作者的影响
对平台团队和开发者而言,成本控制的重心正从模型合同转向平台层。采购时应要求查看“每个验证通过结果的成本”,而不是只看 Token 单价。同时要核查实际服务路径上的缓存占比,这项验证一个下午就能完成,价值可能高于换模型。测试还发现提示词保真度问题:注入 10 万个无关 Token 后,Kilo 和 OpenCode 丢弃了 83% 至 89% 内容却仍报告成功,OpenClaw 拒绝运行,Kimi Code 崩溃。静默截断在输出上看起来与成功无异,需要额外监控。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
一是 Anthropic、OpenAI、Google、Microsoft 在框架层的收费模式已出现分化,DeepSeek 以 MIT 许可证开放运行时,是否会推动框架层透明化;二是 Artificial Analysis 的编码智能体指数能否持续更新,成为可复用的采购依据;三是厂商是否会针对缓存命中率和提示词保真度给出可核查指标。
来源:InfoQ CN


