Claude Sonnet 5.5 发布,Terminal-Bench 4.0 得分 70.6% 且价格不变

Anthropic 发布 Claude Sonnet 5.5,在 Terminal-Bench 4.0 上从 Sonnet 5 的 10.3% 跃升至 70.6%,而 API 价格维持每百万输入/输出 token 2 美元/10 美元不变。它没有靠涨价换性能,而是靠更少 token 和工具调用把单任务成本压低…

一句话看懂:Anthropic 发布 Claude Sonnet 5.5,在 Terminal-Bench 4.0 上从 Sonnet 5 的 10.3% 跃升至 70.6%,而 API 价格维持每百万输入/输出 token 2 美元/10 美元不变。它没有靠涨价换性能,而是靠更少 token 和工具调用把单任务成本压低约 30%。

事件核心:发生了什么

Claude 5.5 家族的第二款模型 Sonnet 5.5 正式发布,是 Sonnet 5 的明确升级版。关键数据有几个:Terminal-Bench 4.0 得分 70.6%,此前 Sonnet 5 仅为 10.3%;输出速度比 Sonnet 5 快 30% 以上;定价保持每百万输入 token 2 美元、每百万输出 token 10 美元,约为 Opus 5.5 的一半。Anthropic 表示,由于单任务消耗的 token 和工具调用次数减少,多数工作场景的总成本最多可下降 30%。模型还提供 effort 档位,用户可自行在推理深度与单任务成本之间取舍。

为什么重要

这次发布更值得看的是经济账,而不是榜单数字。目前公开信息显示,Sonnet 5.5 在 Low 或 Medium effort 档位下的表现即可超过 Sonnet 5 的最高分,而单任务成本约为后者的十分之一;在 FrontierCode 上,High effort 的 Sonnet 5.5 比同档 Sonnet 5 高出约 10 分,成本约为十五分之一。这说明 Anthropic 的优化方向已从“单纯堆推理算力”转向“用更少的调用完成同样的事”,对闭源大模型的商业化路径是一个有代表性的信号。在 Opus 级模型价格居高不下的情况下,Sonnet 级产品承担起走量任务,也会给同类厂商的定价策略带来压力。

对用户/开发者/创作者的影响

对开发者来说,Terminal-Bench 的大幅提升意味着它在命令行、终端类自动化任务上的可用性明显增强,配合 effort 档位,可以按任务难度控制 API 开销,批量调用场景尤其受益。Anthropic 将它定位为适合定义较清楚的日常工作,例如软件调试、编码、文档生产、制作演示文稿和表格,以及界面设计与优化。对企业和内容团队而言,更低的单任务成本和更快的输出速度,会直接改变“哪些环节可以交给模型跑”的边界。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是 effort 档位在真实项目中的性价比表现,是否有第三方复现 Terminal-Bench 与成本数据;二是 Opus 5.5 与 Sonnet 5.5 的价差会不会促使更多团队把生产负载下移到 Sonnet 级;三是竞品是否跟进“不涨价、靠效率降本”的路线,以及这套定价能否长期维持。

来源:X:Rohan Paul (@rohanpaul_ai)

celebrityanime
celebrityanime
文章: 26164

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注