一句话看懂:WAIC 2026 上,多位技术负责人指出:Agent 落地后账单失控的根源不是 Token 单价,而是上下文膨胀、人工审核、反复试错与系统维护等容易被低估的隐性成本。企业真正需要优化的指标,是“完成一次有效任务”的总资源消耗。
事件核心:发生了什么
在 WAIC 2026 期间,InfoQ 围绕“AI 正在重写什么?”主题举办系列对话。其中,优刻得 CTO 王凯与焱融科技 CTO 张文涛讨论了 Agent 进入企业生产环境后的真实成本问题。
两位嘉宾的共识是:普通聊天只需一次模型调用,而 Agent 任务往往涉及目标理解、任务拆解、工具调用、上下文读取、结果验证等完整链路。任何一个环节出错,Agent 都可能重新规划甚至从头执行。尽管模型单价持续下降,但企业调用总量、基础设施压力和人工干预成本可能同步上升。王凯认为,企业首先要回答的不是“Token 贵不贵”,而是“这些 Token 花得值不值”——如果任务目标、评价标准和成功定义都不清晰,AI 就会在无限试错中消耗资源。
张文涛补充称,企业最容易漏算的是人的时间、结果质量和后续维护成本。AI 生成的代码不能直接投产,仍需工程师审查、测试和验收;同时,Agent 的记忆与上下文会不断累积,缺少压缩和缓存机制时,后期单次调用成本可能远高于初期。
为什么重要
这一讨论揭示了 AI 商业化过程中一个被普遍误读的指标:Token 单价。大模型厂商不断降价,给企业造成“AI 越来越便宜”的直觉,但真正决定成本的是任务成功率与资源消耗总量。如果企业只盯着每百万 Token 的价格,而忽略上下文管理、人工审核和系统维护,AI 投入的 ROI 很可能被严重高估。
InfoQ 报道进一步指出,AI Coding 是当前落地最快的场景之一,但“生成代码”与“投入生产”之间仍有巨大距离。王凯提出两条路线:一是沿用传统软件工程结构,用 AI 逐个改造需求、编码、测试、审查环节;二是让 Agent 自主完成中间流程,人只评价最终结果。前者适合多数传统企业,后者更适合从零开始的 AI Native 公司。目前公开信息显示,两种路线均面临流程稳定性与组织管理层面的挑战。
对用户/开发者/创作者的影响
开发者与 AI 应用团队:建议建立“任务成功率优先”的选型思路。先使用能力较强的模型跑通工作流,再拆分环节,将图片识别、信息提取等固定任务替换为更便宜的小模型或传统程序,只在最终分析时调用强模型。同时,需要为 Agent 配置记忆压缩、摘要提取和 KV Cache 等基础设施,防止上下文无限膨胀。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
企业技术决策者:不应只向员工发放一个 API Key 就放任使用。至少需要用量可见、日志审计、多 Key 管理、限速限流等治理能力。对于传统企业,可以适度鼓励试用以降低学习门槛;对于 AI 制药等不确定较强的创新项目,宜采用项目预算制,允许试错但设置投入上限。
普通用户:需意识到 Agent 的“自主性”背后是持续的资源消耗。一个看似简单的任务,可能对应多次模型调用与人工复核,这最终会反映在服务定价或企业采购决策上。
值得关注的后续
一是上下文管理技术能否成为推理基础设施的标配。王凯与张文涛均提到 KV Cache、记忆压缩和缓存机制的重要性,相关服务商是否会推出更成熟的计费与优化方案,值得观察。
二是企业级 Agent 治理工具的市场空间。用量监控、任务评价、多模型编排与可替换架构,正在从“加分项”变成“必选项”,未来可能出现专门的成本治理产品。
三是多模型切换是否会常态化。张文涛指出,公开模型 API 已具备一定标准化,锁定效应较弱;但私有化部署仍存在硬件、框架与模型格式的适配成本。企业能否将提示词、规则与工作流沉淀为可迁移的 Skill,将决定其长期议价能力。
来源:InfoQ CN


