GPT-6 Astra测试数据罗生门:OpenAI频繁修改成绩引「刷榜」质疑,大模型基准测试信任危机爆发

OpenAI 在发布 GPT-6 Astra 后多次修改其基准测试数据,尤其将幻觉率从 4.2% 降至 2% 后又改回,引发业内对“刷榜”的质疑,也让大模型评测体系的公信力再度成为焦点。

OpenAI 在发布 GPT-6 Astra 后多次修改其基准测试数据,尤其将幻觉率从 4.2% 降至 2% 后又改回,引发业内对“刷榜”的质疑,也让大模型评测体系的公信力再度成为焦点。

Anthropic 的 Claude 在黎曼猜想证明中取得突破,将零点在临界线上的下界推高至 67.25%,随后人类数学家完成精简、机器验证工具 Lean 当天通过校验。AI 与人类协作解决超难数学问题的闭环首次跑通。

Anthropic 因使用盗版书籍训练大模型,启动总额 15 亿美元的和解金发放,但出版商与作者之间因分配比例和版权归属问题出现公开争议,反映出大模型训练数据合规的善后远比想象中复杂。

越来越多的餐厅开始使用 AI 生成的菜单图片来节省成本,但图片质量引发的食客反感正在成为新的公关风险,甚至出现线下涂鸦抗议。这一现象折射出 AI 内容在真实商业场景落地时的“信任溢价”问题。

CCTV 财经报道显示,AI 短剧制作价格出现断崖式下降,每分钟报价从 5000 元跌至数百元,逼近成本线。行业竞争重点正在从“能不能做”转向“内容好不好”,同质化产能正在加速出清。

OpenAI 的 GPT-6 Astra 通过新增的 Provider Adapter harness,在 ARC-AGI-3 半私密评测中拿下 99.95% 的高推理得分,远超标准 harness 的 62.7%,显示评测框架本身对模型能力的释放有了决定性的影响。

瑞银(UBS)开始在初级投行岗招聘中明确要求候选人具备 AI 技能,成为首批将 AI 素养设为硬性门槛的大型金融机构之一。这一变化意味着 AI 使用能力正从“加分项”变为核心岗位的必备技能。

AI创作者“知识猫”推出一套针对MiniMax H3视频模型的反推提示词模板,用GPT辅助解析参考视频,把近期火爆的“地铁换装”类短视频生成门槛大幅降低,单条内容在X平台获近20万次浏览。

9月5日,抖音上一段名为《千禧幻觉》的AI生成短片因用荒诞画面暗讽教育内卷、社会竞争与民生问题而引发广泛共鸣。短片本身是展示AI视频叙事能力的典型案例,也再次将“AI内容是否算艺术表达”和“AI生成内容的边界”推向讨论中心。

一条关于“黄果短剧是否由 AI 生成以及用哪个工具制作”的普通提问帖在 X 平台获得超 61 万次浏览,侧面反映出 AI 生成视频在特定题材内容上的传播速度和用户好奇心,也暴露出公众对 AI 视频生成工具能力边界与使用门槛的认知空白。