OpenRouter 实测 Jev 1.13 与 Claude Opus 5 在 Banking77 分类任务上的准确率、延迟与成本

OpenRouter 用 3080 条 Banking77 银行客服语料实测了 TypeSafe 的专用判断模型 Jev 1.13 与 Claude Opus 5,Jev 准确率只落后 3.3 个百分点,但中位延迟快 13 倍、成本仅为后者的约 1/22。

OpenRouter 用 3080 条 Banking77 银行客服语料实测了 TypeSafe 的专用判断模型 Jev 1.13 与 Claude Opus 5,Jev 准确率只落后 3.3 个百分点,但中位延迟快 13 倍、成本仅为后者的约 1/22。

Claude Code 发布 v2.1.280,把 Claude Opus 5.5(claude-opus-5-5)设为默认 Opus 模型,支持 100 万 token 上下文,价格为每百万 token 输入 4 美元、输出 20 美元;同时修复了大量终端交互与 auto 模式的安全问题。

Anthropic 发布 Claude Opus 5.5,官方称多数任务上达到 Fable 5.1 的水平,运行成本比 Opus 5 低 40%;开发者 Boris Cherny 用同一项 C 转 Rust 工程实测后,称其比 Fable 5.1 更快、且便宜 51%。

Anthropic 推出 Claude Opus 5.5,宣称其性能对标 Fable 5.1,同时把运行成本压到比 Opus 5 低约 40%,继续在“能力不降、价格下探”的方向上推进旗舰模型迭代。

亚马逊已封禁 Meta 的 Muse AI 购物 Agent,理由是它未经授权访问商店、不主动表明机器人身份,且会接触并存储用户账号凭证。这意味着"AI 替你下单"这件事,正撞上电商平台对流量和广告收入的实际控制权。

思科旗下威胁情报团队 Talos 发布开源框架 CAIRN,专门用来分类和分析“集成了 AI 能力”的恶意软件——通过追踪 AI 元数据与行为指纹,让这类新型攻击变得可识别、可归类。它之所以重要,是因为安全行业此前缺乏针对 AI 恶意软件的统一分析标准。

金融科技公司 Baselayer 用 AI 帮金融机构核验企业身份、评估欺诈风险,刚完成 3500 万美元 A 轮融资,由 M13 领投,累计融资约 4000 万美元。

澳大利亚医疗 AI 初创公司 Heidi 拿到 3.4 亿美元新融资,其中 1 亿美元 C 轮由 Blackbird 领投,估值 9 亿美元,累计融资超过 4.3 亿美元。这说明资本仍在加注垂直行业的 AI 应用层,而不是只盯着基础大模型。

美国科罗拉多州一位三个孩子的母亲 Sara Sprong 用 ChatGPT 为家庭定制可打印的假期活动手册、寻宝游戏和游戏化家务表,把 AI 生成能力从"屏幕内的娱乐"转向"纸质线下互动",以此压缩孩子的屏幕时间。

为 OpenAI 提供数据标注的第三方外包人员,因在“提供人类反馈”的工作中使用 AI 工具而被提前解约。这件事之所以被讨论,是因为标题容易被读成“OpenAI 员工用 AI 替代自己反被开除”,而事实指向的是外包合同与数据污染问题。