Greg Brockman 转发:GPT-6 Astra 在 ARC-AGI-3 达到 SOTA,基准趋于饱和

OpenAI 的 GPT-6 Astra 在 ARC-AGI-3 基准测试上取得 63% 的 SOTA 成绩,搭配新评测框架后可达 99%,OpenAI 联合创始人 Greg Brockman 随即宣布该基准已“饱和”。这或意味着智能评测的焦点将被迫从抽象推理转向更复杂的现实任务。

一句话看懂:OpenAI 的 GPT-6 Astra 在 ARC-AGI-3 基准测试上取得 63% 的 SOTA 成绩,搭配新评测框架后可达 99%,OpenAI 联合创始人 Greg Brockman 随即宣布该基准已“饱和”。这或意味着智能评测的焦点将被迫从抽象推理转向更复杂的现实任务。

事件核心:发生了什么

ARC Prize 官方于 2026 年 9 月 3 日发布评测结果,OpenAI 的 GPT-6 Astra 在 ARC-AGI-3 上取得 63% 的得分(当前最佳水平),而在一种新的 provider adapter harness 评测框架下,得分可提升至 99%。ARC Prize 同时指出,该模型在 96% 的关卡上超越了人类表现,并且能够对全新环境构建出“迄今最精准的符号化模型”。Greg Brockman 转发时配文称“arc-agi-3 is now saturated”,意味着该测试集对前沿模型的区分度已经耗尽。值得注意的是,该模型性能飞跃距离 ARC-AGI-3 发布的时间并不长,评论区已有开发者质疑评测资格分配不透明,认为 OpenAI 因此获得了不对等的先发优势。

为什么重要

这不仅是 OpenAI 在纯推理测试上的一次领先,更是对 ARC 系列基准生命周期的一次警示:当模型能够以 99% 的通过率完成此前被认为“AI 难以触达”的抽象推理任务时,继续堆叠同类型测试的意义大幅降低。传统上,ARC-AGI 被用来衡量模型在未见任务上的泛化能力,而它的饱和会推动行业寻找更复杂、更具动态性的评测维度。对竞争格局而言,这意味着 OpenAI 在推理效率与符号建模上的积累已经形成护城河;而对中小模型厂商来说,单纯通过扩充训练数据或加大算力来追赶 ARC 指标的路已经基本被堵死。同时,测试门槛演变为“谁能进入评测圈”本身也成为新的议题,模型能力之外的评估权限分配正成为新的争议点。

对用户/开发者/创作者的影响

对于普通用户,基准饱和意味着日常使用的 AI 应用在形式逻辑、图形规律推断等任务上的可靠性将进一步提升,但在真实世界长尾场景中仍存在不确定性。开发者和企业采购方在评估模型时,不应再将 ARC-AGI-3 高得分等同于真实业务中的“通用智能”,建议关注模型在新领域知识获取、可靠调用工具和符号推理与自然语言结合的实战表现;若想复用类似能力,需留意 OpenAI 的 API 接入策略是否支持自定义推理链路。对创作者而言,这次更新预示未来生成工具在理解复杂规则和空间关系时会更加精准,尤其是在需要多步骤逻辑编排的内容生产任务中会有积极影响,但相关能力在闭源生态内的开放节奏仍需观望。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

目前公开信息显示,GPT-6 Astra 的评测细节及接入权限尚未完全向公众开放。后续观察重点有三:一是该评测框架(provider adapter harness)是否会向第三方评测机构开放,以验证 99% 成绩的可复现性;二是 OpenAI 是否会将该能力转化为实际可用的 API 功能并调整定价;三是 Anthropic、Google DeepMind 等竞争者是否会在类似 ARC-AGI-4 或更具连续决策性质的测试集上重新定义更高维度,推动下一轮智能比拼。

来源:X:Greg Brockman (@gdb)

celebrityanime
celebrityanime
文章: 22238

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注