Agent 编程能力从 10% 飙到 70%,Anthropic 新模型却遭遇灵魂拷问:我什么时候才会用它?

Anthropic 于 9 月 28 日发布 Claude Sonnet 5.5,编程 Agent 能力大幅提升,Terminal-Bench 4.0 从上一代 10.3% 跃升至 70.6%,但代价是最高推理强度下单任务成本反升,连部分开发者都开始追问:我什么时候才会用它?

一句话看懂:Anthropic 于 9 月 28 日发布 Claude Sonnet 5.5,编程 Agent 能力大幅提升,Terminal-Bench 4.0 从上一代 10.3% 跃升至 70.6%,但代价是最高推理强度下单任务成本反升,连部分开发者都开始追问:我什么时候才会用它?

事件核心:发生了什么

距离 Claude Opus 5.5 发布不到一周,Anthropic 推出 Claude Sonnet 5.5,成为 5.5 家族第二款模型,Haiku 5.5 预计未来几周登场。官方称输出速度提升超 30%,多数任务所需 Token 更少,单任务成本最高降低 30%。这一定位下,编程是核心升级方向:Terminal-Bench 4.0 从 10.3% 升至 70.6%,超过 Opus 5.5;CursorBench 得分 55.5%,与 Opus 5.5 的 57.8% 仅差约两个百分点。

价格延续 Sonnet 5:每百万输入 Token 2 美元、输出 10 美元,均为 Opus 5.5 的一半。但 Artificial Analysis 测试显示,推理强度调至 Max 时,Sonnet 5.5 每项任务平均生成约 19.3 万输出 Token,为测试模型中最高,单任务成本达 7.60 美元,比 Sonnet 5 高约 50%。

为什么重要

Sonnet 系列一直承担“高性价比中档模型”角色。Sonnet 5.5 把中档模型推到接近 Opus 的水平,说明 Anthropic 在 Agentic Coding 这条线上加速下放能力,用更少工具调用和 Shell 执行换取效率,直接回应了 Claude Code 等 Coding Agent 的真实瓶颈。但这也暴露一个结构性矛盾:性能上探到旗舰区间后,Max 档的 Token 消耗和成本也不再是“中档”,中端与旗舰的边界正在模糊。同时,Sonnet 5.5 是首款加入网络安全分类器和模型回退机制的 Sonnet,高风险请求可能被交给较弱的 Sonnet 5 处理,这为能力开放加了一层合规约束。

对用户/开发者/创作者的影响

对 API 用户,优势集中在高频、边界明确、可验证的任务,如批量修 Bug、补测试、处理 CI 或并行运行多个 Agent,用 Medium 或 High 设置能体现单价减半的价值。但一旦拉到 Max,成本优势迅速消失。对每月 100 美元或 200 美元的 Max 订阅用户,固定月费下 Opus 5.5 已能覆盖多数日常工作,切换 Sonnet 5.5 缺少迫切理由,Hacker News 上已有用户直言“不知道自己什么时候才会用它”。此外,API 开发者需主动启用服务器端 fallback,否则被判定为高风险的请求会直接返回拒绝;即便选择 Sonnet 5.5,最终执行的也可能是 Sonnet 5。目前公开信息显示,Artificial Analysis 测试中约 0.1% 的任务触发回退,但该数字仅来自基准测试,不代表真实生产环境。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是 Sonnet 5.5 在 Max 档的 Token 消耗问题是否会在后续版本优化,还是成为中档模型上探旗舰性能的固定代价。二是 Haiku 5.5 登场后,Anthropic 内部 Sonnet、Opus、Haiku 的定位是否重新划分,中端模型的存在意义需要更清晰的场景解释。三是网络安全回退机制在真实生产环境中的触发比例和误伤情况,将影响开发者对 Sonnet 5.5 稳定性的判断。

来源:InfoQ CN

celebrityanime
celebrityanime
文章: 26262

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注