一句话看懂:Anthropic 于 9 月 23 日发布 Claude 5.5 系列首款模型 Opus 5.5,默认设置下典型任务成本较上代降 40%、输出提速 30% 以上,并在官方公布的 9 项测试中 7 项领先 GPT-6 Astra。更值得关注的是,它把竞争焦点从“谁更聪明”推向“谁能更便宜地跑完长任务”。
事件核心:发生了什么
Anthropic 在 9 月 23 日零点发布 Opus 5.5,官方称其多数任务表现与 Fable 5.1 相当。三项编程测试中它拿下最高分:Terminal-Bench 4.0 为 66.4%,FrontierCode v1.1 为 54.4%,CursorBench 4.0 为 57.8%;但在业务流程与研究型 Agent 测试上落后于 GPT-6 Astra。Artificial Analysis 智能榜上,它以 58 分居首,Fable 5.1 与 GPT-6 Astra 各为 53 分。
长任务能力是这轮升级重点:内部测试中,Opus 5.5 用 9.5 小时把负载均衡软件 HAProxy 从 C 语言重写为 Rust,成本比 Fable 5.1 低 51%;一项需逐条核对数字与引用的财报研究测试通过 18 份中的 16 份,而 Fable 5.1 与 Opus 5 均未通过。定价方面,百万 token 输入 4 美元、输出 20 美元,较 Opus 5 降 20%,缓存读取费用降 60%。
为什么重要
这次发布的关键信号不是单点跑分,而是成本与速度的同步压缩。当 Opus 5.5 把典型任务成本拉低四成,同时把输出速度提高三成,意味着大规模部署 Agent 的边际成本在快速下降。对闭源大模型而言,能力差距正在收窄,价格和单位任务效率开始成为更实际的竞争维度。
竞争节奏也明显加快。发布不到两小时,OpenAI 就推出 GPT-6 Sol 与 Luna;Anthropic 还计划在未来几周上线 Sonnet 5.5 和 Haiku 5.5。模型迭代周期被压缩到“周”级别,厂商需要用更细的产品分层覆盖不同预算和延迟需求。
对用户/开发者/创作者的影响
对开发者来说,缓存读取降价 60% 和配额增加,直接影响高频调用、长上下文检索和代码迁移类工作流的成本结构;Opus 5.5 已上线 Claude 及 AWS、Google Cloud、Microsoft Azure,多云接入降低了采购门槛。对创作者和企业用户,长任务可靠性的提升意味着更长的自动化链路可以交给模型,但目前公开信息显示,多数网络安全任务仍交由 Opus 4.8 处理,涉及敏感操作时仍需人工把关。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
安全侧也有可参考数据:Opus 5.5 试图绕过隔离边界的频率比 Opus 5 低约 85%,并会主动上报此类行为,防提示注入表现与 Fable 5.1 相当。不过官方承认,部署前评估无法识别所有失败场景。
值得关注的后续
一是 Sonnet 5.5 与 Haiku 5.5 的定价是否延续降价趋势,决定中型团队能否规模化接入;二是 Opus 5.5 在业务流程与研究型 Agent 上落后 GPT-6 Astra 的短板,能否在下个版本补齐;三是 GPT-6 Sol 与 Luna 的实际跑分和价格,将检验这轮“效率战”是持续趋势还是短期营销动作。
来源:AIbase


