Artificial Analysis Intelligence Index v4.2

AI 模型评测机构 Artificial Analysis 发布 Intelligence Index v4.2,新增体现实战能力的智能体知识工作测试与超长文档推理测试,并将 40% 的评测权重转移到私有测试集,以遏制模型厂商针对公开榜单“刷分”。Anthropic 与 OpenAI 的最新模型继续领跑。

一句话看懂:AI 模型评测机构 Artificial Analysis 发布 Intelligence Index v4.2,新增体现实战能力的智能体知识工作测试与超长文档推理测试,并将 40% 的评测权重转移到私有测试集,以遏制模型厂商针对公开榜单“刷分”。Anthropic 与 OpenAI 的最新模型继续领跑。

事件核心:发生了什么

Artificial Analysis 于 2026 年 9 月 4 日发布 Intelligence Index v4.2。这是一次提前释放的临时版本更新,官方表示是为了应对过去几周快速演进的大模型竞争格局。v4.2 的主要变化有三项:第一,新增名为 AA-Briefcase 的内部评测集,使用私有测试集评估模型在复杂项目中处理“多周级知识工作”的能力,这类任务通常包含数千个输入源文件和多项关联子任务,由行业专家构建;第二,加入 Surge AI 开发的 GDP.pdf 评测,覆盖 100 份 PDF 共 4,592 页内容,横跨十大领域,要求模型综合文本、表格、图表、脚注和排除项进行单轮专业文档推理,并以 1,275 条原子标准打分;第三,将私有测试集的权重从 v4.1 的两成提升至四成,一定程度防止实验室定向优化公开测试集。

结果显示,Anthropic 的 Claude Fable 5.1 位列总榜第一,OpenAI 的 GPT-6 Astra 紧随其后,较 GPT-5.6 Sol 提升 4 分;Meta 为第三名,其后依次是 SpaceXAI、Moonshot/Kimi、Z.AI 与 Google。在成本效率前沿上,Anthropic、OpenAI、Meta 与 Z.AI 四家实验室共同占据最优位置,而 GPT-6 Astra 则在输出 token 效率上明显优于同级别模型。AA-Briefcase 单项中,Claude Fable 5.1 和 Opus 5 领先,GPT-6 Astra 较 GPT-5.6 Sol 高出约 85 Elo 点;GDP.pdf 单项则由 GPT-6 Astra 以 33.2% 的 All-pass Rate 领先。

为什么重要

这次更新值得关注的核心不是某个模型的分数变化,而是评测方法论本身的转向。以往不少第三方榜单高度依赖公开测试集,模型厂商可以通过在训练语料中覆盖类似题目“刷高分数”,导致榜单与真实使用体验脱节。v4.2 将四成权重调整为私有测试集,并加入以多步任务、长文档推理为特征的评测项,意味着评测机构正尝试把衡量标准推向“模型在真实工作中好不好用”,而不是“模型能不能答对考试题”。这一点对行业判断模型能力差异、定价合理性乃至开源与闭源路线的讨论,都会提供一份更有参考价值的坐标系。

另一个信号是头部厂商的领跑局面正在多元化。Anthropic 与 OpenAI 虽仍位居前二,但 Meta、Z.AI 等实验室已经挤入成本效率前沿,说明在综合能力接近的前提下,单位成本与推理效率正成为下一阶段竞争的关键变量。

对用户/开发者/创作者的影响

对普通用户而言,新版榜单更贴近“把任务交给 AI 做一周工作”的真实场景,选型时可优先关注 AA-Briefcase 这类实战评测表现,而非只盯着基准测试分数;对开发者和企业采购方来说,GDP.pdf 这类长文档评测直接关系到法律、金融、学术等需要跨长文检索与逻辑综合的落地场景,GPT-6 Astra 与 Claude Fable 5.1 在该类任务上表现突出,可作为 API 选型的参考依据。此外,四成私有权重也提醒开发者:依赖公开榜单做技术决策的风险正在上升,最好结合实际业务数据做小规模验证。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

目前公开信息显示,Artificial Analysis 计划在 v5 中继续提高私有测试集占比,并预告近期还有多次增量更新。对市场而言,以下三点值得跟踪:一是 GPT-6 Astra 的长文档优势能否延续到多轮交互与长周期智能体任务中;二是 Meta 与 Z.AI 在成本效率上的领先是否会推动价格调整,进而压缩闭源头部模型的议价空间;三是 AA-Briefcase 这类“行业专家构建”的评测是否会形成新的第三方标准,被更多企业采购方采纳为选型依据。

来源:Hacker News (黑客新闻)

celebrityanime
celebrityanime
文章: 22088

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注