Fireworks AI 推出 FireRouter with Opus:编码任务成本降 57%,准确率仅损失 1.5 个百分点

Fireworks AI 推出面向 Claude Opus 系列的缓存感知路由器 FireRouter with Opus,内部实测编码任务成本下降 57%,准确率仅损失 1.5 个百分点,并已通过 serverless endpoint 对外开放。

一句话看懂:Fireworks AI 推出面向 Claude Opus 系列的缓存感知路由器 FireRouter with Opus,内部实测编码任务成本下降 57%,准确率仅损失 1.5 个百分点,并已通过 serverless endpoint 对外开放。

事件核心:发生了什么

Fireworks AI 发布了 FireRouter with Opus,官方称这是市场上首个针对 Claude Opus 系列优化的缓存感知路由模型,目前已作为独立路由模型通过 serverless endpoint 提供服务。在超过一个月的内部 A/B 测试中,该方案在编码任务上达到单独使用 Opus 时 98.1% 的准确率,同时降低成本 57%。

具体数据方面:每次会话成本从 15.36 美元降至 6.63 美元,降幅 57%(±19 个百分点,95% 置信区间);评分轮次中 FireRouter with Opus 得分 78.7%,单独使用 Opus 为 80.2%,差距 1.5 个百分点(±1.3)。缓存命中率为 94.2%,对照组为 97.8%,相差 3.6 个百分点。测试流量来自内部编码业务,会话被随机分配到路由组和纯 Opus 对照组,工作量与用户相同。

为什么重要

FireRouter 的核心逻辑不是简单按任务难度切换模型,而是把 prompt 缓存成本纳入每次路由决策:评估模型池中每个模型对当前任务的适配度,估算包括缓存在内的处理成本,再权衡“切换模型省下的钱”是否值得“丢掉已缓存内容”的代价,最后选择质量与成本平衡最佳的模型。当前路由池包括 Claude Opus 5.5、GLM 5.3 和 GLM 5.3 Flash,并会随新模型发布持续调整。

这反映出一个正在成型的趋势:在大模型推理成本仍然高企的阶段,竞争焦点正从“单模型能力”转向“多模型调度与缓存效率”。把简单、常规的轮次交给更便宜的模型,把复杂任务留给闭源旗舰模型,这种混搭路线对依赖 API 的团队有直接的成本意义。

对用户/开发者/创作者的影响

对开发者和企业采购方来说,这类路由层的价值在于不改变应用接口的前提下压低账单。缓存命中率下降 3.6 个百分点是明确写在数据里的取舍,官方也承认这是有意为之——用一部分缓存复用率换取整体成本大幅下降。对以编码、Agent 等高频多轮场景为主的团队,57% 的成本差异值得做一次自己的 A/B 验证,而不是直接照搬官方结论,因为 95% 置信区间上下浮动达 19 个百分点。对普通用户和内容创作者,短期内更可能体现为调用相关 API 的 AI 应用价格更稳或功能更丰富,而非直接感知到路由层的存在。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是路由池后续是否会接入更多闭源与开源模型,以及是否会公布非编码任务(如长文本、图像生成相关调用)的成本与准确率数据;二是缓存感知路由在缓存命中率上的损失是否可优化,尤其对强依赖 prompt 缓存的长会话应用;三是主流模型厂商和云平台是否会跟进类似的多模型路由能力,从而改变 API 层的竞争方式。

来源:AIbase

celebrityanime
celebrityanime
文章: 26224

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注