一句话看懂:Anthropic 新一代模型 Claude Fable 5.1 在 Artificial Analysis 智能指数上以 66 分登顶,成为目前测得的最高分,但每任务成本比 Fable 5 高出约 20%,主要原因是输出 token 消耗量明显增加。
事件核心:发生了什么
据 Artificial Analysis 官方账号发布的评测数据,Claude Fable 5.1 在“最大努力”模式下于 Artificial Analysis 智能指数取得 66 分,超过 Claude Opus 5(63 分)、Claude Fable 5(62 分)、GPT-5.6 Sol(61 分)和 Grok 4.6(61 分)。该评测由 Anthropic 提供预发布访问支持,并使用默认的服务端回退机制——约 4% 的输出 token 被路由到 Claude Opus 4.8 或 Claude Opus 5。本次测试覆盖 100 万 token 上下文窗口,支持图像和文本输入。
在具体基准上,Fable 5.1 在 HLE 上得分 59.1%,高于 Fable 5 的 55.5%;在 Terminal-Bench v2.1 取得 91.4%,在 SciCode 取得 62.0%,均为测试记录中的最高水平;在 τ³-Banking 上比 Fable 5 高出 9 分。定价方面,Anthropic 将缓存读取价格从每百万 token 1 美元降至 0.25 美元,降幅为 75%,但标准输入与输出价格仍维持每百万 token 10 美元和 50 美元不变。
为什么重要
这次登顶的意义不仅在于单项分数领先,更在于它同时展示了两个趋势:一是模型智能水平仍在快速爬升,Fable 5.1 在多个代理型工作负载评测上刷新纪录;二是推理成本结构正在变得复杂化——虽然缓存价格大幅下调,但模型在“最大努力”下每任务成本反而比上一代更高,原因是输出 token 使用量约为 Fable 5 的 1.7 倍。这意味着高性能模型在复杂任务中的实际算力消耗并不会因缓存优惠而自动降低。
从竞争格局看,Fable 5.1 在智能指数与输出 token 的帕累托前沿上占据上端位置。评测显示,所有在智能指数上高于 GPT-5.6 Sol(medium)的模型变体,都能被某个 Fable 5.1 的 effort 档位在智能和 token 消耗上同时匹配或超越。这为 Anthropic 在高强度代理任务场景中提供了更强的竞争力,但也将压力转向成本控制能力。
对用户/开发者/创作者的影响
对于 API 开发者和企业采购团队,最直接的信号是:如果任务以缓存读取为主(如代理型、多轮工具调用场景),新的 0.25 美元缓存读取价格能显著降低单次调用开销,评测中约每任务节省 1.40 美元。但如果你的应用依赖长输出或高 effort 设置,Fable 5.1 的每任务成本会比 Fable 5 高约 20%(最大努力模式下每任务 3.76 美元,xhigh 档位则为 2.72 美元)。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
对代理商和知识工作类应用的开发者来说,Fable 5.1 在 GDPval-AA v2(1853 Elo)和 AA-Briefcase(1694 Elo)上刷新了记录,但评测也指出它与 Claude Opus 5 在这些任务上差距有限——优势集中在分析质量和规则正确性上,在展示呈现维度反而落后。这意味着选型时可能需要结合具体任务偏好,而不是简单看总分。
值得关注的后续
后续可以重点关注三个方向:第一,Fable 5.1 面向公众的 API 定价是否会在正式上线时调整,特别是缓存读取价格能否长期维持 0.25 美元水平;第二,GPT-5.6 Sol 和 Grok 4.6 等竞品是否会针对智能指数发布新版本或调整 effort 策略来反超;第三,Fable 5.1 在 GDPval 上的领先是否稳定——目前它在 GDPval-AA v2 相对 Opus 5 的优势尚在置信区间内,未来更大规模测试或第三方复测可能改变排序。


