OpenAI GPT-6 Astra 在 ARC-AGI-3 上取得 SOTA 并超越人类动作效率基线

OpenAI 的 GPT-6 Astra 在 ARC-AGI-3 基准测试中取得 SOTA 成绩,最高配置下以 99.9% 的得分率和 $19K 的推理成本刷新纪录,并在动作效率上超过人类中位数基线——模型开始学会用更少的“操作”解决未知环境问题。

一句话看懂:OpenAI 的 GPT-6 Astra 在 ARC-AGI-3 基准测试中取得 SOTA 成绩,最高配置下以 99.9% 的得分率和 $19K 的推理成本刷新纪录,并在动作效率上超过人类中位数基线——模型开始学会用更少的“操作”解决未知环境问题。

事件核心:发生了什么

ARC Prize 官方于 2026 年 9 月 3 日发布的博客显示,OpenAI 的 GPT-6 Astra 在 ARC-AGI-3 Semi-Private 测试集中取得两项 SOTA 成绩:使用 Standard harness(允许模型在环境中携带自选笔记)时,max 推理等级得分为 62.7%,成本为 $26,098;使用 Provider Adapter harness(保留请求间的推理状态并支持上下文压缩)时,high 推理等级得分达到 99.9%,成本为 $18,817。值得注意的是,Astra 在 96% 的关卡中,所用动作数少于参与对照测试的人类中位数。

ARC-AGI-3 是该系列第三代基准,专门测试智能体在未知、抽象的回合制环境中进行探索、建模、目标设定与规划执行的能力。官方强调,这套环境仅包含人类核心知识先验,人类可 100% 完成测试。

为什么重要

这次结果的意义不在于分数本身,而在于 Astra 展现出的“效率逻辑”。它并未依赖更多推理次数来堆高得分,而是把陌生游戏机制转化为紧凑的符号世界模型——用逻辑规则表示游戏机制,甚至自创了一套领域专属的代数简写来跟踪状态与规划行动。这意味着模型的推理开销与任务熟练度呈反向关系:解决得越好,调用越少,成本越低。

从行业角度看,这直接挑战了“更强模型 = 更贵推理”的既有认知。ARC Prize 官方给出的对比是:人类参与者每场测试约收费 $12.78(主要付给时间与意愿),而若只按大脑耗能折算电价,每次尝试成本仅约 0.067 美分。Astra 以 $19K 完成整个测试集的成本结构,开始让“机器以接近人类效率获取新技能”的 AGI 定义有了实证参照。

对用户/开发者/创作者的影响

对 API 开发者与 AI 应用设计者而言,Astra 的行为模式提供了一个值得借鉴的产品思路:模型主动将长上下文压缩为自创的领域语言,而不是被动依赖越来越大的上下文窗口。这提示开发者在设计 agent 工作流时,可以鼓励模型“记笔记”并保留推理状态,而非每次都从零开始。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对企业采购决策者来说,此次结果中“higher reasoning levels generally cost less”的反直觉现象是一个可验证的商业信号:在复杂 agent 任务中,选择更高推理等级未必增加账单,反而可能因减少无效动作而降低总 token 消耗。不过目前公开信息显示,这仍是单一基准上的表现,实际生产环境中的成本曲线还需更多案例验证。

值得关注的后续

首先,关注 OpenAI 是否会将 Provider Adapter harness 这类“状态保留 + 压缩”能力通过 API 正式开放给第三方开发者,这将直接影响 agent 类应用的工程架构。其次,观察 ARC Prize 是否会针对 Astra 的自创符号表示方法推出新的对抗性测试——毕竟若模型能把未知环境快速转译成内部 DSL,基准的“未知性”设计就需要升级。最后,竞品(如 Google DeepMind、Anthropic)在 ARC-AGI-3 上的回应也值得留意,因为这类效率型智能体的评测方法可能取代单纯的准确率竞赛。

来源:Hacker News 热门(buzzing.cc 中文翻译)

celebrityanime
celebrityanime
文章: 22268

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注