OpenRouter 实测 Jev 1.13 与 Claude Opus 5 在 Banking77 分类任务上的准确率、延迟与成本

OpenRouter 用 3080 条 Banking77 银行客服语料实测了 TypeSafe 的专用判断模型 Jev 1.13 与 Claude Opus 5,Jev 准确率只落后 3.3 个百分点,但中位延迟快 13 倍、成本仅为后者的约 1/22。

一句话看懂:OpenRouter 用 3080 条 Banking77 银行客服语料实测了 TypeSafe 的专用判断模型 Jev 1.13 与 Claude Opus 5,Jev 准确率只落后 3.3 个百分点,但中位延迟快 13 倍、成本仅为后者的约 1/22。

事件核心:发生了什么

2026 年 9 月 22 日,OpenRouter 发布对比测试。它把 Banking77 数据集完整测试集(3,080 条、77 类银行意图)分别送入 Jev 1.13 和 Claude Opus 5,两者使用同一套人工编写的一行式意图判据。结果显示:Jev 准确率 81.0%,Opus 84.4%,配对 bootstrap 的 95% 置信区间为 2.3 至 4.4 个百分点,说明约 3 分的差距不太可能是噪声;两者在 89.3% 的样本上判断一致。速度与成本差距明显:Jev 中位延迟 175 毫秒、p95 270 毫秒,Opus 中位 2,266 毫秒、p95 3,004 毫秒;整轮费用 Jev 为 0.34 美元,Opus 为 7.44 美元。Opus 的系统提示已开启缓存,若按未缓存价格计,每千次请求成本约 19 美元。

为什么重要

这组数据揭示了一个实际路线选择:在意图分类这类边界清晰的判别任务上,小体量专用模型加结构化 API(Jev 走的是 Decisions API,返回类型化答案与置信度)已经可以接近前沿大模型,而延迟与成本差距是数量级的。这意味着“所有任务都用最强的通用大模型”这一默认做法正在被细分。对行业而言,竞争焦点从单纯堆参数,转向“准确率、延迟、成本”三者的可量化权衡,也会推动更多团队按任务类型做模型路由。

对用户/开发者/创作者的影响

开发者如果正在做客服意图识别、工单分类或任何标注体系固定的判别任务,可以优先评估专用小模型,把大模型留给开放推理场景。Opus 每千次 2.42 美元与 Jev 的 0.11 美元之间,量级差距会直接改变产品单位经济模型。同时要留意:两者均在 81% 至 84% 区间,明显低于在全部 10,003 条训练集上微调的编码器模型所报告的 90% 出头,说明用一行式判据做零样本分类本身仍有天花板;类别层面差异也很大,Opus 在 receiving_money 上以 80.0% 对 52.5% 领先,Jev 则在 compromised_card 上以 95.0% 对 70.0% 反超,选型前应按自身意图分布分别测。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是这类对比是否扩展到更多任务类型,而不只限于分类;二是 Jev 的置信度分数能否支撑可靠的路由策略,即低置信样本自动转交大模型,从而在整体上进一步压低成本;三是 OpenRouter 排名页上分类任务的支出结构是否会因成本差异而改变。目前公开信息显示,尚无关于 Jev 更广泛基准表现或定价调整的进一步消息。

来源:OpenRouter:Announcements(RSS)

celebrityanime
celebrityanime
文章: 25063

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注