智能体请求暴增9.4倍,token账单却没涨:Uber 公开AI软件工厂省钱方法

Uber 在自家 AI 软件工厂中,通过模型路由、上下文压缩、MCP 工具改造等手段,在智能体请求量增长 9.4 倍的同时稳住 AI 总支出,并公开了可复用的成本拆解公式与优化方法论。

一句话看懂:Uber 在自家 AI 软件工厂中,通过模型路由、上下文压缩、MCP 工具改造等手段,在智能体请求量增长 9.4 倍的同时稳住 AI 总支出,并公开了可复用的成本拆解公式与优化方法论。

事件核心:发生了什么

在 2026 年 AI 工程师大会上,Uber 披露了其 AI 软件工厂的最新运营数据。自 2026 年 2 月至 8 月,公司内部所有智能体产品的周活跃用户数增长 7 倍,周智能体请求量增长 9.4 倍,超过 70% 的代码合并请求由智能体生成。与此同时,通过一系列成本优化,AI 总支出从 4 月起保持稳定。Uber 还公布了固定模型下的对照测试结果:每 1000 次模型请求的成本较峰值下降近 34%,每次会话成本较 6 月峰值下降 52%。这些数据表明,其成本控制并非依赖模型降价或减少用量,而是来自内部架构和调度策略的系统性调整。

为什么重要

这是目前少见的、由大型科技公司公开的 AI 成本治理细节。Uber 没有停留在“用了多少 AI”的叙事层面,而是将智能体会话成本拆解为六个可独立度量的因子,并针对每个因子给出具体优化手段。其中包括:按工作负载匹配帕累托最优模型、为子智能体默认配置性价比更高的模型、通过自动压缩和推理强度设置控制单次请求 token 量、为提示词缓存选择合适的 TTL 时长,以及将 MCP 工具调用从标准协议改为 CLI 解析和代码模式。这些做法本质上是在不牺牲质量的前提下,把 token 消耗和模型调用效率做到极致,对同样承受大模型推理成本压力的企业有直接参考价值。

对用户/开发者/创作者的影响

对于使用大模型 API 的开发者或企业团队,Uber 的做法提供了几个可落地的思路:一是不要盲目追求前沿模型,应基于真实业务任务构建基准测试,再选择成本与效果平衡的配置;二是多智能体协作时,主模型和子智能体应使用不同等级和价位的模型;三是工具调用环节,MCP 服务器动辄数万 token 的 Schema 开销可以被 CLI 封装或工具检索机制大幅削减。对创作者和普通用户而言,这类优化最终会反映在 AI 工具的价格与响应速度上——企业推理成本下降,才有可能让更复杂的 AI 功能以更低价格开放给终端用户。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是 Uber 这套成本优化方法是否能被更多企业复制,尤其在中型团队中,效果是否会因代码库规模和智能体工作流复杂度而打折扣;二是其内部构建的 Uber SWE 基准测试和 AI 上下文图谱(目前包含 2400 万个节点)是否会以开源或服务形式对外输出;三是随着多智能体编排能力增强,子智能体默认模型策略是否会成为各家企业 AI 软件工厂的标准配置,并推动模型供应商调整分层定价结构。目前公开信息显示,Uber 的成本降幅基于其自身环境测算,实际效果需结合具体业务负载验证。

来源:InfoQ CN

celebrityanime
celebrityanime
文章: 21235

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注