一句话看懂:Anthropic 发布 Claude Sonnet 5.5,在 Artificial Analysis 智能指数上以 56 分升至第二,仅次于 Opus 5.5;但单任务输出 token 与成本明显高于前代,性价比成为主要争议点。
事件核心:发生了什么
据 Artificial Analysis 2026 年 9 月 28 日发布的评测,Anthropic 推出 Claude Sonnet 5.5。在最大推理强度下,该模型在 Artificial Analysis 智能指数上得分 56,比 Sonnet 5 高出 18 分,排名升至第二,仅落后 Opus 5.5(max)2 分。
API 价格与 Sonnet 5 保持一致:每百万缓存输入、输入、输出 token 分别为 0.2、2、10 美元。但 Sonnet 5.5 在每项任务上的输出 token 约 193k,为评测机构迄今测得最高,约为 Opus 5.5(max)和 Sonnet 5(max)的 1.6 倍、GPT-6 Astra(max)的 7 倍,导致单任务成本升至约 7.6 美元,比 Sonnet 5 高约 50%。
能力分布上,Sonnet 5.5 在 Terminal-Bench 4.0 达到 64%,高于 Opus 5.5 和 GPT-6 Astra 的 60%;在 AA-Briefcase、GDPval-AA、AutomationBench-AA 上与 Opus 5.5 基本持平。但在事实知识与科学推理上仍落后于 Opus 5.5。
为什么重要
这组数据反映出一个关键趋势:中端模型正在逼近旗舰模型的智能水平,但代价是更高的 token 消耗。Sonnet 5.5 不在智能与单任务成本的帕累托前沿上——高推理强度下不如 Opus 5.5,中低强度下 GPT-6 Astra 或 Sol 能以更低成本提供相近性能。
对 Anthropic 而言,Sonnet 5.5 强化了智能体终端操作和知识工作场景的竞争力;对行业而言,它再次说明“智能指数高”不等于“单位成本最优”,模型竞争正从跑分转向每美元智能的比拼。
对用户/开发者/创作者的影响
开发者若沿用 Sonnet 5 的调用习惯,需注意实际账单可能上涨约一半。在终端自动化、多步骤 agent 工作流中,Sonnet 5.5 的 Terminal-Bench 表现有吸引力,但高频调用场景应优先对比 GPT-6 Sol 或 Astra 的高强度配置。对内容创作者和企业采购来说,若任务以事实问答或科学推理为主,Opus 5.5 仍是更稳的选择;Sonnet 5.5 更适合对终端操作和 agent 任务有明确需求的团队。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
一是正式版修复结构化输出 bug 后,评测成绩是否会上调;二是 Anthropic 是否针对高 token 消耗调整定价或推出更省的推理档位;三是 GPT-6 Sol、Astra 等竞品是否会跟进降价或更新版本,改变当前的成本性能对比。


