GPT-6 Astra测试数据罗生门:OpenAI频繁修改成绩引「刷榜」质疑,大模型基准测试信任危机爆发

OpenAI 在发布 GPT-6 Astra 后多次修改其基准测试数据,尤其将幻觉率从 4.2% 降至 2% 后又改回,引发业内对“刷榜”的质疑,也让大模型评测体系的公信力再度成为焦点。

一句话看懂:OpenAI 在发布 GPT-6 Astra 后多次修改其基准测试数据,尤其将幻觉率从 4.2% 降至 2% 后又改回,引发业内对“刷榜”的质疑,也让大模型评测体系的公信力再度成为焦点。

事件核心:发生了什么

当地时间 9 月 3 日,OpenAI 正式发布 GPT-6 Astra 模型,但发布过程并不顺利:公告一度被撤下、页面长时间无法访问,官方起初称是内容管理系统故障和网络中断所致,否认与基准测试结果有关。然而,博客重新上传并多次更新后,外界发现模型评估数据经历了多轮修改——最受争议的是 Astra 的幻觉率先是下降一半至 2%,随后又改回最初的 4.2%。此外,GPT-5.6 Sol 的幻觉率、OpenAI 内部网络安全测试得分也出现波动;更值得注意的是,连 Anthropic 等竞争对手模型的个别性能分数也同步下跌又回升,有部分数据调整甚至发生在官方首版博客发布之前。

面对质疑,OpenAI 解释称调整目的是让数据尽可能真实反映模型表现,测试条件等客观因素会影响最终结果。但频繁的数据变动仍让多位 AI 研究者怀疑存在“分数美化”,也把行业由来已久的基准测试准确性问题再次摆上台面——此前 Meta 也曾因类似问题陷入信任危机。

为什么重要

基准测试分数是目前大模型市场定位和企业采购决策的核心参考依据。OpenAI 作为行业头部玩家,其发布过程中数据反复修改,影响的不只是单一产品的口碑,而是整个评测体系的公信力。若测试数据可以被主观调整,企业客户和二级市场投资者将难以判断模型真实能力,对比不同厂商模型时也缺少可靠锚点。对 OpenAI 而言,长期构建的“技术领先”叙事依赖亮眼跑分支撑,此次事件若无法妥善回应,会削弱其在一级市场融资和 B 端业务拓展中的说服力。

对用户/开发者/创作者的影响

对普通用户和开发者而言,模型跑分与实际体验之间本就存在落差,此次事件提醒:在选型或调用 API 时,不应只盯榜单数字,需结合特定业务场景做小范围实测,尤其是对幻觉率敏感的知识问答、代码生成等任务。对依赖大模型做内容生产的创作者,幻觉率高低直接影响信息可靠性,面对争议数据更应保持谨慎。对计划采购企业级 AI 服务的团队,建议要求厂商提供可复现的测试条件与评测细节,而非只看宣传材料中的单一指标。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

首先,OpenAI 是否会公开完整、可复现的评测方法和具体测试条件,将是挽回信任的关键一步。其次,行业能否借此加速建立统一、透明的基准测试标准——若监管机构或第三方评测组织介入,对 Meta、Anthropic、Google 等厂商的评估方式都会产生连带影响。另外,GPT-6 Astra 的真实性能仍需第三方独立测试验证,后续是否有来自学术机构或评测平台的报告,值得持续跟踪。

来源:AIbase

celebrityanime
celebrityanime
文章: 22159

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注