GPT-6 Astra评分引发质疑后,Artificial Analysis对其Intelligence Index进行全面调整

因 GPT-6 Astra 在此前评测中得分仅与前代持平、引发广泛质疑,Artificial Analysis 发布 Intelligence Index 4.2 版,重新校准评测体系与权重,使 Astra 得分较上一代提升 4 分,但 Anthropic 的 Claude Fable 5.1 仍居榜首。

一句话看懂:因 GPT-6 Astra 在此前评测中得分仅与前代持平、引发广泛质疑,Artificial Analysis 发布 Intelligence Index 4.2 版,重新校准评测体系与权重,使 Astra 得分较上一代提升 4 分,但 Anthropic 的 Claude Fable 5.1 仍居榜首。

事件核心:发生了什么

Artificial Analysis 于 9 月 5 日发布 Intelligence Index 4.2 版本,这是对 4.0 版评分争议的正式回应。此前,多套评测将 OpenAI 的 GPT-6 Astra 置于领先位置:Epoch AI 在 50 多个基准上给 Astra 打出 169 分,位列 267 个模型之首;ARC-AGI-3 也显示 Astra 相较前代有明显代际跃升。但 Artificial Analysis 的旧版指数却显示 Astra 与其前代 Sol 打平,这种评估结果与业界观感严重脱节,引发了对该指数方法论的质疑。

新版指数调整了两方面内容:一是新增 AA-Briefcase(模拟真实知识工作)和 Surge AI 的 GDP.pdf(针对 PDF 文档解析)两个基准,同时移除已被模型“做穿”的 GPQA-Diamond;二是将私有测试集权重提升至 40%,以降低模型“刷榜”空间。此外还修正了多个基准的计分错误,并调整打分机制以获得更稳定的排名。

调整后,GPT-6 Astra 排名第二,较前代 Sol 高出 4 分,Anthropic 的 Claude Fable 5.1 仍保持第一,Meta 位列第三。Artificial Analysis 还指出,Astra 在单任务 token 消耗上是所有前沿模型中最低的;在成本-性能比维度上,Anthropic、OpenAI、Meta 和智谱 AI 并列领先。

为什么重要

这次更新反映出第三方 AI 评测面临的一个深层问题:模型能力跃迁的速度已超过评测体系的迭代能力。Artificial Analysis 在说明中坦承,为了在主要模型发布期间保持分数稳定,他们一度推迟了版本更新,但头部排名的变动速度迫使其实施“中期修订”。这说明在一个以月为单位的竞争节奏里,静态基准很容易失真——如果连专业的第三方机构都出现“该涨没涨”的评分误差,那么普通用户仅凭跑分选择模型的风险正在加大。

另一个值得注意的行业信号是:私有测试集权重被提高到 40%。这意味着榜单的可信度越来越依赖“不公开的考题”,而非外界可复现的基准。这有助于防止模型针对公开测试集做定向优化,但也让外部研究者更难独立验证排名合理性,对榜单的长期公信力提出了新挑战。

对用户/开发者/创作者的影响

对开发者而言,如果此前仅依据 Artificial Analysis 的旧版榜单做模型选型,可能会低估 GPT-6 Astra 的实际能力;新版数据提供了更贴近真实表现的参照。Astra 在较低 token 消耗下实现同等水平的任务完成度,这对按 token 计费的 API 调用成本有直接影响,值得纳入成本测算。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对普通用户和企业采购者来说,这次事件提醒:任何单一排行榜都只是参考,不同评测体系的基准构成和权重设计会影响最终排名。两个权威榜单给出冲突结论时,最好结合自身业务场景做小样本实测,而非盯着排名数字做决策。

对内容创作者而言,Artificial Analysis 新增的 AA-Briefcase 和 GDP.pdf 基准意味着评测开始更关注真实办公场景——如文档分析、知识整理类任务,这比纯粹的数学或代码竞赛更贴近日常 AI 使用体验,可作为工具评测时的参考维度。

值得关注的后续

首先,Artificial Analysis 表示已开发 8 个月的 5.0 版本将分阶段上线,届时评测体系是否会引入更多动态基准、如何平衡版本更新频率与分数稳定性,值得留意。其次,OpenAI 是否会针对“Astra 推理成本最低”这一结果调整 API 定价策略,或以此作为商业化卖点,是观察点之一。最后,Claude Fable 5.1 还能保持领先多久——目前公开信息显示 Anthropic 尚无发布下一代模型的明确时间表,但 Meta 及中国厂商的追赶速度将决定下一次榜单排位变动的时点。

来源:The Decoder AI News

celebrityanime
celebrityanime
文章: 21990

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注