一句话看懂:AI 应用架构设计的优先级正在反转:先选模型是低效做法,真正重要的是搭建一个“路由层”,让 70-80% 的请求分流到成本接近为零的本地或异步模型上。Coinbase 已通过此类方法将 AI 支出降低近一半,同时 token 用量仍在增长。
事件核心:发生了什么
风投机构 Wing VC 的数据分析师 Tom Tunguz 近期撰文,提出“模型选择是最后一步,而不是第一步”的观点。文章指出,多数团队在构建 AI Agent 时先选定模型再设计架构,这属于本末倒置。核心要素是一个负责“调度”的路由器(Router),它由三部分组成:技能分类器(Skill Classifier,识别用户意图,判断任务是草拟回复、总结代码库还是执行迁移)、路由器本身(根据复杂度、上下文大小、历史成功率等特征,决定由哪一层级的模型执行)、以及模型选择器(在同一层级内挑选最便宜且达到置信阈值的模型)。
这一架构的量化依据来自低成本推理的普及:本地模型调用免费,异步批处理推理的成本比实时推理低两个数量级。Tunguz 团队已将该逻辑内置到其 Agent 运行环境中,并叠加了两种反馈机制——同步失败模式预测器和基于夜间批量评估的闭环权重更新系统,后者运行在异步推理服务 Sail 上,评估成本趋近于零。
为什么重要
这一观点直指当前 AI 应用开发中普遍存在的成本浪费问题。行业默认将模型 API 费用视为固定成本,但 Tunguz 提出的“执行路由”框架,实际上是将成本控制从“事后监控”前移到“架构设计阶段”。Coinbase 首席执行官 Brian Armstrong 上周在 X 平台披露的数据提供了佐证:该交易所通过优化默认配置、路由与缓存,在 token 用量指数级增长的同时将 AI 支出削减近半。
如果“技能蒸馏”(Skill Distillation)能进一步标准化操作集合,非编码类 Agent 流量中将有大部分不再需要经过昂贵的云端大模型实时推理。这意味着推理成本的竞争焦点,正从模型单价谈判转向调度效率的工程能力。
对用户/开发者/创作者的影响
对开发者:架构设计的优先级需要调整。将意图识别(语言问题)与请求调度(调度问题)分离,而不是把模型选择逻辑硬编码进提示词(Prompt),才能实现跨模型 A/B 测试与成本优化。技能分类器与路由器的解耦,是实现 70-80% 流量分流至本地或异步模型的前提。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
对企业技术决策者:AI 预算并不必然随用量线性上涨。当前公开信息显示,按量付费的实时推理并非唯一选项;具备排队机制的系统可有效压低实时响应需求。多数任务如草拟回复、代码库总结、尽调备忘录、夜间评测运行,均属于可延迟处理类型。
对普通用户:该趋势的直接影响是终端 AI 功能或服务的价格可能下降,因为服务商在后台将越来越多的请求转移至廉价计算资源,而不影响前台响应体验。
值得关注的后续
1. 路由器开源生态是否形成:目前相关实践多是各团队内部自建,尚未看到标准化、开源的路由框架出现,这是开发者社区值得留意的空白点。
2. 异步推理服务(如 Sail)的商业化进展:异步批处理推理价格优势显著,但其市场渗透率将取决于主流云厂商是否将其作为独立、低价的计费层级推向市场。
3. 技能蒸馏的成熟度:将各类复杂任务压缩为本地小模型可处理的标准操作,是决定“路由优先”架构能否从少数团队扩散至行业主流的关键变量。


