大多数 AI 工作可以稍后再做

AI 应用架构设计的优先级正在反转:先选模型是低效做法,真正重要的是搭建一个“路由层”,让 70-80% 的请求分流到成本接近为零的本地或异步模型上。Coinbase 已通过此类方法将 AI 支出降低近一半,同时 token 用量仍在增长。

一句话看懂:AI 应用架构设计的优先级正在反转:先选模型是低效做法,真正重要的是搭建一个“路由层”,让 70-80% 的请求分流到成本接近为零的本地或异步模型上。Coinbase 已通过此类方法将 AI 支出降低近一半,同时 token 用量仍在增长。

事件核心:发生了什么

风投机构 Wing VC 的数据分析师 Tom Tunguz 近期撰文,提出“模型选择是最后一步,而不是第一步”的观点。文章指出,多数团队在构建 AI Agent 时先选定模型再设计架构,这属于本末倒置。核心要素是一个负责“调度”的路由器(Router),它由三部分组成:技能分类器(Skill Classifier,识别用户意图,判断任务是草拟回复、总结代码库还是执行迁移)、路由器本身(根据复杂度、上下文大小、历史成功率等特征,决定由哪一层级的模型执行)、以及模型选择器(在同一层级内挑选最便宜且达到置信阈值的模型)。

这一架构的量化依据来自低成本推理的普及:本地模型调用免费,异步批处理推理的成本比实时推理低两个数量级。Tunguz 团队已将该逻辑内置到其 Agent 运行环境中,并叠加了两种反馈机制——同步失败模式预测器和基于夜间批量评估的闭环权重更新系统,后者运行在异步推理服务 Sail 上,评估成本趋近于零。

为什么重要

这一观点直指当前 AI 应用开发中普遍存在的成本浪费问题。行业默认将模型 API 费用视为固定成本,但 Tunguz 提出的“执行路由”框架,实际上是将成本控制从“事后监控”前移到“架构设计阶段”。Coinbase 首席执行官 Brian Armstrong 上周在 X 平台披露的数据提供了佐证:该交易所通过优化默认配置、路由与缓存,在 token 用量指数级增长的同时将 AI 支出削减近半。

如果“技能蒸馏”(Skill Distillation)能进一步标准化操作集合,非编码类 Agent 流量中将有大部分不再需要经过昂贵的云端大模型实时推理。这意味着推理成本的竞争焦点,正从模型单价谈判转向调度效率的工程能力。

对用户/开发者/创作者的影响

对开发者:架构设计的优先级需要调整。将意图识别(语言问题)与请求调度(调度问题)分离,而不是把模型选择逻辑硬编码进提示词(Prompt),才能实现跨模型 A/B 测试与成本优化。技能分类器与路由器的解耦,是实现 70-80% 流量分流至本地或异步模型的前提。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对企业技术决策者:AI 预算并不必然随用量线性上涨。当前公开信息显示,按量付费的实时推理并非唯一选项;具备排队机制的系统可有效压低实时响应需求。多数任务如草拟回复、代码库总结、尽调备忘录、夜间评测运行,均属于可延迟处理类型。

对普通用户:该趋势的直接影响是终端 AI 功能或服务的价格可能下降,因为服务商在后台将越来越多的请求转移至廉价计算资源,而不影响前台响应体验。

值得关注的后续

1. 路由器开源生态是否形成:目前相关实践多是各团队内部自建,尚未看到标准化、开源的路由框架出现,这是开发者社区值得留意的空白点。

2. 异步推理服务(如 Sail)的商业化进展:异步批处理推理价格优势显著,但其市场渗透率将取决于主流云厂商是否将其作为独立、低价的计费层级推向市场。

3. 技能蒸馏的成熟度:将各类复杂任务压缩为本地小模型可处理的标准操作,是决定“路由优先”架构能否从少数团队扩散至行业主流的关键变量。

来源:Hacker News · 24h最热

celebrityanime
celebrityanime
文章: 20096

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注