No idea if these specific numbers generalize across tasks, but directionally it’s clear that the harness is going to become the most important variable -right next to model capability- in the AI stack. The ability for…

Box CEO Aaron Levie提出,AI技术栈中“工具链/编排层”(harness)正在成为仅次于模型能力的关键变量。Composio的同日实测数据显示,不同Agent工具链处理同一批任务的平均成本最高相差约3.7倍,成本控制正从模型层转移到调度层。

一句话看懂:Box CEO Aaron Levie提出,AI技术栈中“工具链/编排层”(harness)正在成为仅次于模型能力的关键变量。Composio的同日实测数据显示,不同Agent工具链处理同一批任务的平均成本最高相差约3.7倍,成本控制正从模型层转移到调度层。

事件核心:发生了什么

2026年8月1日,Aaron Levie在X上发帖判断:当单个AI任务消耗的token从几十万、几百万级增长到几千万甚至几亿级时,工具链如何拆解任务、如何在正确时间路由到正确模型,将直接决定整体准确率和推理成本。他坦言目前没有证据表明单一数字能跨任务通用,但方向是明确的。

支撑这一判断的是Composio发布的一组Agent成本实测数据:Hermes Agent平均每任务成本0.39美元,Pi Agent为0.40美元,Codex为0.47美元,OpenCode为0.51美元,Kimi Code为0.54美元,而Claude Code达到1.47美元,约为Pi Agent的3.7倍。中位数成本呈现出同样的排序,Pi Agent和Hermes均约为0.29美元。

为什么重要

长期以来,AI行业把注意力集中在模型本身的训练和推理效率上,但Levie指出了一个正在发生的结构性变化:任务规模变大后,工具链的编排效率开始主导总成本。过去任务只有几十万token时,即使调度不合理,浪费也有限;但当任务达到亿级token时,一次低效的任务拆解或模型路由就会带来显著的算力损耗。

这意味着AI竞争的维度正在拓宽。模型能力仍然重要,但同样规格的开源、闭源模型,配上不同的工具链,实际使用成本和准确率可能出现数倍差距。对企业采购者而言,只看模型API单价已经不够,工具链的调度策略会变成新的成本变量,这也为中间层创业公司提供了机会。

对用户/开发者/创作者的影响

开发者在选择Agent框架或编码工具时,需要把成本纳入日常评估。Claude Code的实测成本显著更高,但它可能在某些复杂编码任务上换取更高的准确率;而Pi Agent、Hermes在成本敏感型任务上优势明显。具体选型应基于自己的任务类型做小规模押注测试,而非只看品牌或模型名。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对企业和个人创作者来说,如果工作流中大量依赖Agent批量处理生成、总结、图像生成等任务,工具链带来的成本差异会直接反映在月度API账单上。目前公开信息显示,这类成本数据尚未跨任务验证,不建议仅凭一组测试就迁移核心工具链。

值得关注的后续

一是这组成本数据是否会在更多任务类型和更大token规模下复现,尤其是百万级token的长任务场景;二是各Agent工具链是否会针对成本优化更新版本,或者以准确率为由维持溢价;三是模型路由能力是否会从实验室走向标准化,成为类似API网关一样的基础设施层产品。无论哪个方向,工具链本身正在从一个配角变成值得单独评估的技术变量。

来源:Follow Builders · X · Aaron Levie

celebrityanime
celebrityanime
文章: 16394

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注