一句话看懂:Anthropic 发布小模型 Claude Haiku 5.5,在 Artificial Analysis 智能指数上得分 43,比上一代 Haiku 一年前的成绩提升 26 分,并首次引入 effort 设置、自适应思考和按上下文长度分档的定价机制。
事件核心:发生了什么
据 Artificial Analysis 在 X 上发布的信息,Anthropic 已推出 Claude Haiku 5.5。该模型在 Artificial Analysis 智能指数上得分为 43,相比上一次 Haiku 发布(一年前)提高了 26 分。
Haiku 5.5 是首个具备 Anthropic effort 设置和自适应思考(adaptive thinking)的 Haiku 模型,同时 Anthropic 为其引入了阶梯定价。在 100k tokens 以内的提示中,输入/输出价格为每 100 万 tokens 0.10 美元/0.50 美元,与 GPT-6 Luna 相同,约为上一代 Haiku 价格的 10%;超过 100k tokens 后,价格升至 0.50 美元/2.50 美元,为前者的 5 倍。Artificial Analysis 同时指出,其网站尚未反映阶梯定价,因此 Haiku 5.5 的临时成本数据未包含涨价部分,后续将补充 Cost per Task 覆盖。
其他规格方面,Haiku 5.5 的上下文窗口从 Claude 4.5 Haiku 的 200k 提升至 100 万 tokens;缓存读取价格为 0.01 美元(超过 100k 后 0.05 美元),5 分钟缓存写入为 0.125 美元(超过 100k 后 0.625 美元);支持文本与图像输入,输出为文本。
为什么重要
小型模型历来在智能指数上落后于旗舰模型,Haiku 5.5 以 43 分超过 GLM-5.3 Flash(42)、Gemini 3.8 Flash(41)和 GPT-6 Luna(38),并与 2.8 万亿参数的开源模型 Kimi K3(44)接近,但仍落后 Claude Sonnet 5.5(max,56)13 分。这意味着小模型在部分评测中已能触及更大参数模型的能力区间。
阶梯定价也值得注意。它把低价区间锁定在 100k tokens 以内,超过后成本提高 5 倍,这会影响长上下文任务的 API 调用成本结构,对高频、长输入的开发场景尤其敏感。
对用户/开发者/创作者的影响
开发者需要重新评估 Haiku 5.5 的成本模型。在 100k tokens 以内的调用中,它比上一代便宜约 90%;但一旦超过阈值,单位成本明显上升,长文档处理、长对话记忆、代码库级分析等场景的实际花费可能高于预期。Artificial Analysis 也提醒,当前临时成本数据未反映阶梯加价。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
在 agentic 知识工作方面,Haiku 5.5(max)在 AA-Briefcase 上达到 1578 Elo,领先 Kimi K3 和 GLM-5.3,与 Muse Spark 1.3(max)接近;在 Terminal-Bench 4.0 上得分为 33%,而 Haiku 4.5 为 0%,与 GLM-5.3 Flash 持平,高于 Gemini 3.8 Flash(20%)和 GPT-6 Luna(13%)。这对需要终端操作和自动化的开发工具是一个可用性信号。
代价是 token 消耗较高。Haiku 5.5(max)在每个智能指数任务上约使用 162k 输出 tokens,约为 GPT-6 Luna(max,约 50k)的 3 倍;从 xhigh 提升到 max 会增加 2 分,但 token 用量约为 1.8 倍。在相近智能水平下,Haiku 5.5(high)以约 55k tokens 得 38 分,GPT-6 Luna(max)以约 50k tokens 得 38 分,差距在更低 effort 设置下进一步拉大。
事实知识方面,Haiku 5.5 的 AA-Omniscience 准确率为 36%,低于 Gemini 3.8 Flash(55%)和 GPT-6 Luna(44%),但幻觉率为 40%,也低于两者的 55% 和 77%。部分原因是它更愿意承认不知道。AutomationBench-AA 得分 35%,低于 GPT-6 Luna、Gemini 3.8 Flash 和 GLM-5.3 Flash 的 53%–60%,但 Artificial Analysis 表示,预发布测试中的安全拒绝问题导致模型过度拒绝,Anthropic 正在修复,后续将重新评测,预期分数会上升。
值得关注的后续
一是阶梯定价何时被 Artificial Analysis 等平台完整纳入成本对比,以及 Cost per Task 数据是否改变 Haiku 5.5 的性价比结论。二是 AutomationBench-AA 的重新评测结果,过度拒绝问题若解决,分数可能明显变化。三是高 token 消耗在真实 agentic 工作流中会如何影响开发者的总体成本和部署选择。


