大家都在构建 LLM 路由器,我们却弃用了自己的。

做 LLM 网关的 Manifest 团队基于 7000 名云用户的实践数据,宣布弃用自己的大模型路由器,并公开总结出“多数场景下,死磕单一主力模型比动态路由更划算”这一反共识结论。

一句话看懂:做 LLM 网关的 Manifest 团队基于 7000 名云用户的实践数据,宣布弃用自己的大模型路由器,并公开总结出“多数场景下,死磕单一主力模型比动态路由更划算”这一反共识结论。

事件核心:发生了什么

Manifest 团队于 2025 年 3 月将 LLM 路由器作为其 LLM 网关的核心功能推出,该路由器会把任务按复杂度分为简单、标准、复杂和推理四档,动态选择最经济的大模型来响应。但在 6 月,团队宣布弃用该功能;9 月 1 日,路由器被彻底关停。

这并非一次仓促叫停。Manifest 在博客中披露了 7000 名云用户、四个月的运行数据,以及大量 GitHub issue 反馈。他们归纳出的核心问题是:提示词本身无法预判任务真实复杂度,工具调用和联网搜索等后续步骤才决定实际开销;缓存读取比路由省钱得多;路由器会让模型行为前后不一致;以及不可预测性本身会带来评估、可观测性和运维上的隐性成本。

为什么重要

当前的 AI 推理成本优化叙事中,“让便宜模型回答简单问题、让贵模型回答难题”的路由逻辑听起来非常合理,近期也有多家公司密集推出类似产品。Manifest 的公开反例提供了另一组可核查的数据:路由省下的 token 开销,很可能被系统性调参、行为对齐和排查问题所吃掉。

更值得注意的,是 Manifest 对“工程师该不该关心模型选择”这一命题的立场。他们认为,正如工匠需要了解自己的工具,工程师必须理解不同模型的差异与取舍。这个观点与“用路由把模型决策交给中间层”的行业潮流形成了正面张力。对正在选购网关或接入多家 API 开发者的团队来说,这是一条来自真实生产环境的反向证据。

对用户/开发者/创作者的影响

对这几种角色,事情的启发不太一样:

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

普通 API 使用者,可以重新评估自己的调用模式。如果系统提示词和对话历史占比大,前缀缓存带来的 75%–90% 输入费用折扣,比换来换去选模型更有实际价值。把一套 prompt 固定在一个模型上,往往比动态路由更容易命中缓存。

正在搭建 agent 工作流的开发者,需要认真对待“不可预测性成本”。Manifest 的经验显示,路由器在自动代理场景下引入的不确定性,会让评估集、系统提示词和监控全部复杂化。固定的模型—参数—提示词组合,在多数情况下反而更容易定位和修复问题。

对于只关心生成效果的创作者,这可能意味着:某些“智能路由”宣传的省钱效果,最终会以响应质量波动的方式转移到用户身上。主流模型 + 良好缓存的组合,短期内依旧是最稳妥的性价比方案。

值得关注的后续

目前公开信息显示,Manifest 是明确做出“弃用路由、回归单一模型”决定的团队。接下来值得观察三个方向:一是看好路由的厂商(如近期密集发力的网关和代理类产品)是否会用公开数据回应这一质疑;二是市场上是否会出现“路由时优先考虑缓存命中率”的混合方案——Manifest 自己提到,一个缓存感知的路由器反而会刻意保持模型选择不变,这本质上是在承认路由和缓存之间存在天然矛盾;三是 Manifest 在移除路由器后,其网关产品会不会以更聚焦的姿态获得开发者认可,从而带动团队给出更多关于工作流模板和任务拆分的最佳实践。

来源:Hacker News

celebrityanime
celebrityanime
文章: 16289

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注