基准测试对GPT-6 Astra评价不一,但它在ARC-AGI-3上超越人类的效率,令Chollet的AGI预测提前。

OpenAI 新一代模型 GPT-6 Astra 在第三方评测中出现结论分裂:Epoch AI 将其排在第一,Artificial Analysis 则认为它与前代持平;但在 ARC-AGI-3 测试中,Astra 首次以高于普通人的效率完成陌生游戏环境推理,促使 ARC Prize 负责人 François…

一句话看懂:OpenAI 新一代模型 GPT-6 Astra 在第三方评测中出现结论分裂:Epoch AI 将其排在第一,Artificial Analysis 则认为它与前代持平;但在 ARC-AGI-3 测试中,Astra 首次以高于普通人的效率完成陌生游戏环境推理,促使 ARC Prize 负责人 François Chollet 将 AGI 时间表提前。

事件核心:发生了什么

据 The Decoder 报道,GPT-6 Astra 于 2026 年 9 月面世后,两份独立综合评测给出截然相反的判断。Epoch AI 综合 50 余项基准,给 Astra 打出 169 分,在 267 个参测模型中位列第一;Artificial Analysis 则聚焦知识、编程与文本理解,给出 61 分,与其前代 GPT-5.6 Sol 持平,且低于 Claude Fable 5.1 的 66 分。

最突出的变化出现在 ARC-AGI-3 基准上。该测试将 AI 投入规则不明确、目标未知的陌生游戏环境,要求模型通过试错自主推导行为逻辑。GPT-6 Astra 在内部标准脚手架下达到 62.7% 的准确率,测试成本约 2.6 万美元;前代 Sol 仅为 7.78%,Claude Opus 5 为 30.16%。ARC Prize 创始人 François Chollet 评价称,进展速度比他的预期快了一倍,并相应上调了 AGI 到来的预测时间。需要指出,OpenAI 此前宣传的 99.9% 是在其自研 harness(推理链跨请求保持并自动摘要长程运行)下测出,ARC Prize 认为 62.7% 才是可跨厂商公平比较的数据。

为什么重要

这次评测分歧本身即是行业信号:综合排行榜的算法差异已经大到能对同一模型给出相反结论,单一跑分不再是可靠的采购依据。更值得关注的是推理效率的跃迁——在 ARC-AGI-3 上,Astra 将单次测试成本从无推理时的约 4.98 万美元降至最高推理强度下的 2.61 万美元,准确率却从 35.2% 升至 62.7%。也就是说,思考越充分、解决问题的步骤越少,反而越省钱。ARC Prize 将这一现象归因于 Astra 能用更少的行动步数完成游戏目标,直接减少模型调用次数与 token 消耗。这套“多推理反而更便宜”的技术路径若成立,将动摇算力成本与模型智能之间此消彼长的既有判断,也解释了为何 Chollet 会将 AGI 预期提前——他观察到的不是单点能力突破,而是推理效率的结构性改善。此外,Astra 在 FrontierMath Erdős 测试中成为唯一以 Lean 验证方式解出两道开放数学问题的模型,单次尝试预算 300 美元;虽然额外三次非标运行烧掉超 22 万美元不算分数,但其在开放数学问题上的表现已拉开代际差距。

对用户/开发者/创作者的影响

对企业用户和开发者而言,Astra 的单位文本处理价格是前代的 2.5 倍,单任务成本约上涨 75%,但实际开销取决于任务类型:在编码任务上,它达到与 Claude Fable 5 相同的 Artificial Analysis 得分,单任务成本却不到后者一半,原因是 Astra 只需 Sol 三分之一的推理步数、Opus 5 五分之一的计算量。对成本敏感的生产环境,按 token 计费未必能反映真实支出,按“完成任务所需总成本”评估模型更合理。幻觉率方面,AA-Omniscience 测试中 Astra 较前代从 92% 降至 51%,这对依赖输出可信度的内容生成与客服应用是明显利好;但它在 GDPval-AA v2 上损失约 80 Elo 点,并在银行支撑、SciCode 及长上下文推理任务上出现退化,说明通用能力提升伴随特定技能回退,接入生产前需要针对自身场景做回归验证。创作者若涉及图像生成工作流,目前公开信息显示 Astra 相关能力评测尚未大规模铺开,迁移前宜等待更多独立数据。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

第一,ARC Prize 计划未来同时公布厂商自研 harness 与内部标准 harness 的分数,届时 OpenAI 自报的 99.9% 与第三方口径 62.7% 之间的鸿沟将获得透明对照,或重塑“AI 跑分”的行业规范。第二,Epoch AI 对 Astra 仅收录了中等推理强度下的一次编码得分,其与 Fable 5.1 在不同科目上各占优势——Astra 领先数学、知识与谜题,Fable 5.1 几乎包揽编程测试头名——后续若补齐 Astra 的高强度推理数据,榜单第一的位置仍存变数。第三,Astra 在“无推理”与“低推理”档位之间出现反常的 35.2% 到 17.5% 的分数回退,ARC Prize 对此不予置评,这一异常是否指向模型在中间推理强度下的行为不稳定性,值得在后续版本中持续观察。

来源:The Decoder AI News

celebrityanime
celebrityanime
文章: 22106

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注