Claude Haiku 5.5 发布:智能指数 43 分,首搭 effort 设置与分层定价

Anthropic 发布 Claude Haiku 5.5,在 Artificial Analysis 智能指数上得分 43,比上一代 Haiku 一年前提升 26 分;它首次在 Haiku 系列中加入 effort 设置与自适应思考,并引入 100k token 为界的分层定价。

一句话看懂:Anthropic 发布 Claude Haiku 5.5,在 Artificial Analysis 智能指数上得分 43,比上一代 Haiku 一年前提升 26 分;它首次在 Haiku 系列中加入 effort 设置与自适应思考,并引入 100k token 为界的分层定价。

事件核心:发生了什么

根据 Artificial Analysis 于 2026 年 10 月 7 日发布的评测文章,Anthropic 推出 Claude Haiku 5.5。它在 Artificial Analysis 智能指数上得分为 43,较上一次 Haiku 发布提升 26 分。该模型是 Haiku 系列中首个支持 effort 设置与自适应思考的版本,同时引入了分层定价。

价格方面,100k token 以内的输入/输出价格为每 100 万 token 0.10/0.50 美元,与 GPT-6 Luna 相同,约为上一代 Haiku 的十分之一;超过 100k 后价格升至 0.50/2.50 美元,上涨 5 倍。目前该站点尚未反映分层定价,暂定的成本数据未包含阶梯上涨部分。上下文窗口从 Claude 4.5 Haiku 的 200k 提升至 100 万 token,支持文本与图像输入、文本输出。

为什么重要

在小型模型赛道,Haiku 5.5 在最高 effort 下略高于 GLM-5.3 Flash(42)、Gemini 3.8 Flash(41)和 GPT-6 Luna(38),与 2.8T 参数开源权重模型 Kimi K3(44)接近,但落后 Claude Sonnet 5.5(最高 effort,56)13 分。这说明小模型的能力上限在被继续推高,但闭源中端模型仍留有层级差。

不过 token 效率是它的短板。Haiku 5.5(max)在智能指数每项任务上约消耗 162k 输出 token,约为 GPT-6 Luna(max,约 50k)的 3 倍。从 xhigh 提升到 max 只增加 2 分,却要付出约 1.8 倍 token。在相近智能水平上,它比 Luna 用得更“费”。同时,它在 Terminal-Bench 4.0 上从 Haiku 4.5 的 0% 升至 33%,与 GLM-5.3 Flash 持平,高于 Gemini 3.8 Flash(20%)和 GPT-6 Luna(13%)。在 AA-Briefcase 知识工作评测中,Haiku 5.5(max)达到 1578 Elo,领先 Kimi K3 和 GLM-5.3,与 Muse Spark 1.3(max)相当。事实知识偏低但幻觉率相对更低:AA-Omniscience 准确率 36%,低于 Gemini 3.8 Flash 的 55% 和 GPT-6 Luna 的 44%,但幻觉率 40%,低于后两者的 55% 和 77%。AutomationBench-AA 得分 35%,可能被低估,原因是发布前测试中安全拒答问题导致过度拒绝,Anthropic 正在修复,评测将重跑。

对用户/开发者/创作者的影响

对开发者而言,Haiku 5.5 的低价档位和 100 万 token 上下文适合长文档处理、批量调用和成本敏感型 AI 应用,但超过 100k 后价格跳升 5 倍,需要在提示设计上控制 token 规模。对内容创作者和知识工作者,它在 AA-Briefcase 上的表现接近前沿模型,意味着小模型已可承接部分真实工作任务,但事实准确率偏低,重要事实仍需人工核查。对企业采购,token 消耗偏高可能抵消单价优势,实际成本要等站点支持分层定价后再评估。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是 Anthropic 修复安全拒答后 AutomationBench-AA 重跑结果是否明显上升;二是站点何时支持分层定价,以及每任务成本的真实排名;三是 Haiku 5.5 与 GPT-6 Luna、Gemini 3.8 Flash 在开发者生态中的实际采用情况。以上评测结果仅适用于 Artificial Analysis 在原文日期的测试条件,不构成永久排名。

来源:Artificial Analysis

celebrityanime
celebrityanime
文章: 28212

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注