一句话看懂:因 GPT-6 Astra 在此前评测中得分仅与前代持平、引发广泛质疑,Artificial Analysis 发布 Intelligence Index 4.2 版,重新校准评测体系与权重,使 Astra 得分较上一代提升 4 分,但 Anthropic 的 Claude Fable 5.1 仍居榜首。
事件核心:发生了什么
Artificial Analysis 于 9 月 5 日发布 Intelligence Index 4.2 版本,这是对 4.0 版评分争议的正式回应。此前,多套评测将 OpenAI 的 GPT-6 Astra 置于领先位置:Epoch AI 在 50 多个基准上给 Astra 打出 169 分,位列 267 个模型之首;ARC-AGI-3 也显示 Astra 相较前代有明显代际跃升。但 Artificial Analysis 的旧版指数却显示 Astra 与其前代 Sol 打平,这种评估结果与业界观感严重脱节,引发了对该指数方法论的质疑。
新版指数调整了两方面内容:一是新增 AA-Briefcase(模拟真实知识工作)和 Surge AI 的 GDP.pdf(针对 PDF 文档解析)两个基准,同时移除已被模型“做穿”的 GPQA-Diamond;二是将私有测试集权重提升至 40%,以降低模型“刷榜”空间。此外还修正了多个基准的计分错误,并调整打分机制以获得更稳定的排名。
调整后,GPT-6 Astra 排名第二,较前代 Sol 高出 4 分,Anthropic 的 Claude Fable 5.1 仍保持第一,Meta 位列第三。Artificial Analysis 还指出,Astra 在单任务 token 消耗上是所有前沿模型中最低的;在成本-性能比维度上,Anthropic、OpenAI、Meta 和智谱 AI 并列领先。
为什么重要
这次更新反映出第三方 AI 评测面临的一个深层问题:模型能力跃迁的速度已超过评测体系的迭代能力。Artificial Analysis 在说明中坦承,为了在主要模型发布期间保持分数稳定,他们一度推迟了版本更新,但头部排名的变动速度迫使其实施“中期修订”。这说明在一个以月为单位的竞争节奏里,静态基准很容易失真——如果连专业的第三方机构都出现“该涨没涨”的评分误差,那么普通用户仅凭跑分选择模型的风险正在加大。
另一个值得注意的行业信号是:私有测试集权重被提高到 40%。这意味着榜单的可信度越来越依赖“不公开的考题”,而非外界可复现的基准。这有助于防止模型针对公开测试集做定向优化,但也让外部研究者更难独立验证排名合理性,对榜单的长期公信力提出了新挑战。
对用户/开发者/创作者的影响
对开发者而言,如果此前仅依据 Artificial Analysis 的旧版榜单做模型选型,可能会低估 GPT-6 Astra 的实际能力;新版数据提供了更贴近真实表现的参照。Astra 在较低 token 消耗下实现同等水平的任务完成度,这对按 token 计费的 API 调用成本有直接影响,值得纳入成本测算。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
对普通用户和企业采购者来说,这次事件提醒:任何单一排行榜都只是参考,不同评测体系的基准构成和权重设计会影响最终排名。两个权威榜单给出冲突结论时,最好结合自身业务场景做小样本实测,而非盯着排名数字做决策。
对内容创作者而言,Artificial Analysis 新增的 AA-Briefcase 和 GDP.pdf 基准意味着评测开始更关注真实办公场景——如文档分析、知识整理类任务,这比纯粹的数学或代码竞赛更贴近日常 AI 使用体验,可作为工具评测时的参考维度。
值得关注的后续
首先,Artificial Analysis 表示已开发 8 个月的 5.0 版本将分阶段上线,届时评测体系是否会引入更多动态基准、如何平衡版本更新频率与分数稳定性,值得留意。其次,OpenAI 是否会针对“Astra 推理成本最低”这一结果调整 API 定价策略,或以此作为商业化卖点,是观察点之一。最后,Claude Fable 5.1 还能保持领先多久——目前公开信息显示 Anthropic 尚无发布下一代模型的明确时间表,但 Meta 及中国厂商的追赶速度将决定下一次榜单排位变动的时点。


