Fortune 报道 OpenAI 多次修改 GPT-6 Astra 基准测试数据,部分成绩大幅变化

OpenAI 在发布 GPT-6 Astra 的数小时内多次修改了网页上的基准测试数据,部分模型成绩一度大幅波动(如 Astra 幻觉率一度从 4.2% 降至 2% 后又恢复原值),引发外界对 AI 评测透明度和“刷榜”操作的质疑。

一句话看懂:OpenAI 在发布 GPT-6 Astra 的数小时内多次修改了网页上的基准测试数据,部分模型成绩一度大幅波动(如 Astra 幻觉率一度从 4.2% 降至 2% 后又恢复原值),引发外界对 AI 评测透明度和“刷榜”操作的质疑。

事件核心:发生了什么

据 Fortune 报道,OpenAI 于 9 月 3 日发布 GPT-6 Astra 模型公告的当天,经历了博客上线延迟、短暂撤稿、链接无法访问等异常情况。在页面最终可被公众正常访问后,有互联网档案快照显示,OpenAI 曾多次修改文中各项基准测试数据。

最明显的调整集中在 Astra 的幻觉率上:最初版本为 4.2%,下午 5 点 20 分的快照显示为 2%,而最终又恢复至 4.2%。Anthropic 的 Fable 5.1 在 FrontierMath Tier 4(v2)评测中的成绩也经历了从 87.8% 降至 78%、再回升至 83% 的波动。此外,OpenAI 还曾调高自家前代模型 GPT-5.6 Sol 在 ExploitBench 网络安全评测中的成绩(5.5% 升至 11.5%),并承认该高分对应的是未向商业用户开放的高推理等级。另一个变化是,Astra 在 ARC-AGI-3 的分数从媒体预发布草稿中的 98.6% 调整为公开版博客中的 99.99%,OpenAI 称这是发布前验证流程中的正常修正。

为什么重要

此次事件集中反映了 AI 大模型评测中长期存在的两个问题。其一,评测结果的高度条件依赖性——同一模型在推理等级、工具框架、检查点版本等变量影响下,可以产生多个看起来都“合理”的成绩。其二,公司作为测试执行方与成绩发布方的双重身份,使得公众难以判断数据调整是纠偏还是策略性“刷分”。OpenAI 也承认,博客中公开的成绩是在最佳条件下获得的,可能与用户在正式版 ChatGPT 中实际体验到的模型表现存在差异。

更深一层看,这种发布前后的数据波动正在削弱基准测试作为技术竞赛“记分牌”的公信力。对于计划在 2027 年 IPO、并希望向市场传递“最强模型”叙事的 OpenAI 而言,这种混乱显然不是一个理想信号。尤其在 Meta Llama 4 曾因“修饰成绩”被否定的先例下,行业对任何测试数据调整都会保持高度警惕。

对用户/开发者/创作者的影响

对开发者而言,基准测试成绩与实际 API 行为之间存在系统性偏差,这意味着选定模型时不应只看官方博客中的最高成绩,而应基于自己的测试集在真实推理配置下做评估。目前公开信息显示,GPT-6 Astra 在 ARC-AGI-3 上仅使用标准工具框架时成绩为 63%,远低于发布稿中突出宣传的 99.99%,两者差异巨大——如果企业用户按后者预期规划复杂 Agent 应用,可能面临性能落差。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对于大模型研究者或采购评估人员,建议关注系统卡中的脚注与限制条件,尽量核实其评测方法细节。Fortune 的报道也提到,OpenAI 的系统卡在幻觉率评测方法上的信息披露较为有限,甚至未列出测试项目数量,这给第三方复现带来了困难。

值得关注的后续

第一,OpenAI 是否会按其公开表态修正 ExploitBench 成绩至 5.5%,并公布完整的评测条件变更说明,这是检验其透明度的直接信号。第二,Anthropic 等竞争对手是否会在后续发布中引用这些调整后的数据,或围绕基准测试发布流程形成新的公开规范。第三,需要观察 OpenAI 是否会对 ARC-AGI-3 这类第三方评测给出更详细的条件分级说明,以帮助开发者在不同工具配置下理解模型真实能力与适用边界。

来源:IT之家(RSS)

celebrityanime
celebrityanime
文章: 22040

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注