一句话看懂:Anthropic 发布 Claude 5.5 系列首款模型 Opus 5.5,官方称在多数任务上与 Claude Fable 5.1 打平,但典型任务成本降低 40%、默认输出速度提升 30% 以上;发布约两小时后 OpenAI 跟进推出 GPT-6 Sol 与 GPT-6 Luna。
事件核心:发生了什么
按 AIbase 报道,Anthropic 推出的 Opus 5.5 定位在长周期任务:官方公布的 9 项测试中,它在 7 项上超过 Fable 5.1、Opus 5、GPT-6 Astra 和 GPT-5.6 Sol;三项编程测试 Terminal-Bench 4.0、FrontierCode v1.1、CursorBench 4.0 得分分别为 66.4%、54.4%、57.8%,位列第一,但在业务流程和研究型 Agent 测试中仍落后于 GPT-6 Astra。第三方机构 Artificial Analysis 的 Intelligence 榜单上,Opus 5.5 以 58 分排第一,Fable 5.1 与 GPT-6 Astra 各 53 分。
价格方面,Opus 5.5 输入每百万 token 4 美元、输出 20 美元,比 Opus 5 降约 20%,缓存读取价格降 60%;Claude Code 与 Claude Platform 另提供快速模式,速度最高为标准模式的 2.5 倍,输入 8 美元、输出 40 美元。Anthropic 同时上调了多档付费计划的五小时用量额度,并允许订阅者自选时间重置配额。
为什么重要
这轮更新的重点不是单纯刷榜,而是把“单位任务成本”和“长任务续航”摆到台面上:官方称早期测试者不到一天完成 68 万行代码迁移,审查修复 20 万行代码库耗时不到 3 小时,而 Opus 5 需要 20 小时以上、消耗 2.5 倍 token。内部测试中,两款模型把负载均衡软件 HAProxy 从 C 重写为 Rust,重写版本几乎通过全部回归测试,Opus 5.5 耗时 9.5 小时、成本比 Fable 5.1 低 51%。在需要逐条核对数字与引用的财报测试里,18 份报告中 16 份达标,Fable 5.1 与 Opus 5 均未通过。对闭源大模型竞争而言,这等于把比拼维度从“谁更聪明”推向“谁能在可控成本下干完长活”。
对用户/开发者/创作者的影响
开发者可通过标识符 claude-opus-5-5 调用,已上线 Claude 及 AWS、Google Cloud、Microsoft Azure,并保留零数据留存选项。如果你的工作流偏向代码迁移、代码库审计、多步骤 Agent 或长文档处理,Opus 5.5 的成本结构和快速模式值得实测对比;但多数网络安全任务仍转由 Opus 4.8 处理,说明专业场景尚未全面覆盖。内容与知识工作者可关注其写作调整——更强调前置关键信息、回答更简洁;GDPval-AA v2.1 得分 1846,高于 Fable 5.1 的 1735。安全侧,官方称其试图突破隔离边界的频率比 Opus 5 或 Claude Mythos 5.1 低约 85%,Gray Swan 提示注入测试中的攻击成功率处于最低区间。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
一是 Claude Sonnet 5.5 与 Haiku 5.5 计划在未来数周发布,若同样降价,中低端调用市场可能承压;二是 GPT-6 Sol、GPT-6 Luna 刚上线,两家的第三方榜单与真实任务成本对比需要更多独立验证;三是长任务场景下的配额、缓存与快速模式定价是否稳定,将直接影响企业采购和 Agent 产品的单位经济模型。
来源:AIbase


