OpenRouter 推出 Batch API,批量推理可享半价

OpenRouter 上线 Batch API,把批量推理请求打包提交,价格通常降到按 token 计费的 50%。它换来的是最长 24 小时的交付窗口,但测试数据显示中位完成时间只有 7 分钟。

一句话看懂:OpenRouter 上线 Batch API,把批量推理请求打包提交,价格通常降到按 token 计费的 50%。它换来的是最长 24 小时的交付窗口,但测试数据显示中位完成时间只有 7 分钟。

事件核心:发生了什么

OpenRouter 于 9 月 22 日推出 Batch API,面向不需要即时返回的大批量推理任务。开发者向 api/v1/batches 提交一组请求并指定接口形态,支持 chat completions、responses、messages 和 embeddings。提交后由服务商在 24 小时窗口内自行决定执行时间,作为交换,价格通常是正常每 token 价格的 50%,部分模型更低。该能力目前覆盖 70 多个模型。

OpenRouter 公布了两周 beta 期 23 万多个批次的耗时数据:中位完成时间 7 分钟,90% 在一小时内完成,99% 在 10.3 小时内完成。提交时段比批量规模影响更大,太平洋时间凌晨 5 点到中午明显偏慢,晚 6 点后 90 分位低于 50 分钟。单个请求的批次约 5 到 11 分钟完成,1000 条以上的批次约 12 到 21 分钟。

为什么重要

批处理并非新概念,OpenAI、Anthropic 等厂商都提供类似折扣。OpenRouter 的差异在于它是聚合层:同一套接口横跨多家模型和供应商,默认在用户的白名单、数据策略和 BYOK 设置之后选择最便宜的批量端点。这降低了开发者在不同大模型之间比价和切换的成本。

对整个推理市场来说,批量折扣实质上是在用时间换算力利用率。推理需求已经超过训练成为算力消耗的大头,把非紧急请求挪到低谷时段执行,对服务商是提升 GPU 利用率,对用户是降低单位成本,属于双方都有动机的方向。这也让“半价”逐渐成为推理定价的常规档位,而不是促销手段。

对用户/开发者/创作者的影响

对开发者,Batch API 适合语料标注、embedding 回填、评测集打分、工单批量摘要等可接受响应时间波动的场景,也可以把同一个 prompt 跑几千行数据。每个请求独立返回结果,个别失败不会拖垮整批任务,输入和结果保留 30 天。图像和文件输入必须是公开 URL,音频、视频以及 OpenRouter 自带的网页搜索插件暂不支持,网页搜索按标准价计费。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对企业采购和创作者团队,如果已有 OpenAI 兼容的文本请求体,迁移成本主要是改成异步轮询。需要注意的是,批次默认在单一供应商上执行,BYOK 密钥在支持的供应商上可直接计费,这会影响数据合规路径的选择。

值得关注的后续

一是折扣是否长期稳定,以及是否会扩展到音频、视频等模态;二是其他聚合平台和模型厂商是否跟进更激进的批量价格;三是批量任务对供应商调度能力的压力,太平洋时间上午的延迟高峰是否会随规模扩大而加剧。目前公开信息显示,OpenRouter 尚未披露各模型的具体折扣比例差异。

来源:OpenRouter:Announcements(RSS)

celebrityanime
celebrityanime
文章: 24984

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注