一句话看懂:Uber 在 2026 年 8 月公布的数据显示,全公司超过 70% 的代码合并请求已由 AI Agent 自主发起或完成处理,但整体 AI 支出并未随调用量同步上涨,单次会话成本反而下降了 52%。这说明大模型应用正在从“给人用的工具”转向“替人干活的生产系统”。
事件核心:发生了什么
据 Uber Engineering 官方账号 2026 年 8 月 30 日发布的长文,Uber 将 AI Agent 深度嵌入软件研发全流程,目前公司内部超过 70% 的 pull request 来自本地或云端 Agent。与此同时,Agent 调用量在半年内增长近 10 倍,但 AI 总账单保持不变,单次会话成本被压缩至原来的一半以下。
具体机制上,Uber 将任务拆解与执行分离:规划阶段使用顶级大模型,具体执行交给轻量子 Agent 完成;所有 Agent 统一通过内部网关接入超过 1000 个 MCP 工具,模型在需要时才按需搜索和挂载工具定义,而非在每次请求时一次性注入约 7 万 token 的说明书。此外,Uber 将上下文缓存时间从 5 分钟延长至 1 小时,并强制对 40 万 token 规模的上下文做摘要压缩,避免历史信息被无限复制。
Uber 还自建了一个包含 2400 万节点知识图谱,覆盖全公司服务和历史事故记录。工程师定位问题的时间从过去盲搜代码的 20 分钟缩短至平均 38 秒。目前该系统每天自动执行约 3 万次流水线任务,包括代码审查、CI 修复和报警分诊,人类工程师更多承担抽查和质检工作。
为什么重要
当多数企业还在抱怨大模型 API 账单过高时,Uber 展示了一条完全不同的路径:用量增长并不必然带来成本等比例上升。核心思路是把 AI 账单拆解为“用量 × 单次成本”,Uber 没有限制用量,而是集中精力降低每次会话中的无效 token 消耗。
这背后反映出一个行业趋势:Agent 是否普及,不再取决于模型推理能力,而取决于工程化定价模型。谁能在缓存策略、任务调度和工具调用上做得足够精细,谁就能把大模型从昂贵对话工具变成廉价生产线。对于闭源模型提供商而言,Uber 这种“按需挂载、精打细算”的使用方式也意味着,未来的商业模式可能要从卖 token 数量转向卖整体效率方案。
对用户/开发者/创作者的影响
对开发者和企业技术团队而言,Uber 的做法提供了几个可以直接借鉴的实操思路:第一,任务拆解时应让顶级模型只做规划和判断,把重复性工作切给轻量模型,避免所有请求都走最贵通道;第二,缓存时间设置直接影响成本,适当延长缓存窗口可以显著降低重复计算开销;第三,别把大量工具文档一次性塞进上下文,而是在需要时通过检索动态挂载。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
普通用户使用 AI 产品时也可以关注类似机制:如果一个 AI 应用在复杂任务中响应变慢、费用变高,多半与其没有做好上下文管理有关。未来评价一款 AI 工具,不仅要看它“多聪明”,还要看它“多省钱”。
值得关注的后续
目前公开信息显示,Uber 尚未详细解释这种成本控制方案对工程师日常编码体验的影响——例如,轻量子 Agent 在复杂逻辑推理中的错误率是否高于顶级模型。未来值得观察三个具体点:其一,Uber 是否会把这套 Agent 编排框架对外开放,或部分开源;其二,其他大型科技公司是否会跟进类似的缓存与按需挂载策略,从而倒逼 API 定价体系调整;其三,知识图谱导航如果成为大厂标配,是否会催生一批面向企业内部知识图谱搭建的第三方工具和创业公司。


