UK AISI 与 EvalEval 如何让基准测试结果可复现

英国 AI 安全研究院(UK AISI)开始用 EvalEval 联盟的公开基础设施发布评测结果,首批覆盖 5 个基准测试、6 个前沿模型,让原本散落各处的跑分变成可复现、可对照的公共数据。

一句话看懂:英国 AI 安全研究院(UK AISI)开始用 EvalEval 联盟的公开基础设施发布评测结果,首批覆盖 5 个基准测试、6 个前沿模型,让原本散落各处的跑分变成可复现、可对照的公共数据。

事件核心:发生了什么

2026 年 9 月 22 日,EvalEval Coalition 在 Hugging Face 博客宣布,UK AISI 将采用其基础设施公开分享评测结果。双方的合作始于 2025 年 NeurIPS 期间的一场联合工作坊,AISI 的反馈也参与塑造了「Every Eval Ever」(EEE)这套报告 schema。

此次公开的数据对应 AISI 论文《How Inference Compute Shapes Frontier LLM Evaluation》,覆盖主实验中的 5 个基准:HealthBench、FrontierMath、Humanity’s Last Exam、SWE-Bench Pro、Terminal-Bench 2.0,涉及 Claude Opus 4、4.5、4.6 与 GPT-5、5.2、5.4 六个前沿模型。此外还包含 Cyber CTFs 和 The Last Ones 两项网络评测结果,用的是另一组部分重叠的模型。所有结果通过 Evaluation Cards 平台发布,附带经过核验的分数、上下文和配置信息;AISI 还提供了 transcript 级别的细节。

为什么重要

评测正在成为判断大模型能力的核心证据,但当前结果分散在论文、博客、榜单和厂商公告里,格式各异,往往缺少复现所需的配置信息。重跑一次评测本身可能成本极高,尤其是涉及推理算力的前沿模型测试。AISI 的论文恰好说明,同一模型在 Humanity’s Last Exam 上的表现会随评测协议和推理 token 预算变化——当模型每次尝试后能获得 oracle 的正确性反馈时,随 token 增加会持续解出更多题目。缺乏这些上下文,跨报告的分数对比很容易误导。

EEE schema 和 Evaluation Cards 的价值在于把「分数」和「怎么跑出来的」绑在一起。AISI 此前已通过 OptStop 提升评测效率、用 HiBayES 提高统计严谨性,这次公开数据是把方法沉淀为公共参照点的一步。对开源与闭源模型的横向比较、对评测方法本身的研究(meta-research),都依赖这类可核查的底层数据。

对用户/开发者/创作者的影响

对开发者来说,这是一套可对照的参考基线:在选型或复现时,能直接看到同一模型在不同配置下的分数差异,而不是只拿到一个孤立数字。对做评测工具、榜单或模型卡片的团队,EEE 提供了可对接的 schema,降低了自建报告格式的成本。对企业采购方,带配置信息的核验结果比宣传数字更适合作为决策依据。普通用户在阅读模型能力宣称时,也能多一个判断维度:分数是在什么推理预算和协议下取得的。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是其他评测机构、模型厂商是否会跟进采用 EEE schema 上报结果,形成规模效应;二是 Evaluation Cards 上的数据能否覆盖更多模型版本和更新周期,而不是一次性发布;三是当同一模型出现多份不同配置的公开结果时,社区能否借此建立更清晰的对比口径,而不是制造新的解读混乱。

来源:Hugging Face Blog

celebrityanime
celebrityanime
文章: 25040

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注