OpenAI声称GPT-5.6 Sol凭借其最新API和两项额外设置在ARC-AGI-3上击败Opus 5

OpenAI 宣称其 GPT-5.6 Sol 通过专属 API 设置(保留推理链与上下文压缩)在 ARC-AGI-3 逻辑基准上取得 38.3% 的成绩,超过了 Anthropic Claude Opus 5 的 30.2%。但该成绩并非出自官方标准测试环境,ARC 奖联合创始人回应称通用 API 设置合规…

一句话看懂:OpenAI 宣称其 GPT-5.6 Sol 通过专属 API 设置(保留推理链与上下文压缩)在 ARC-AGI-3 逻辑基准上取得 38.3% 的成绩,超过了 Anthropic Claude Opus 5 的 30.2%。但该成绩并非出自官方标准测试环境,ARC 奖联合创始人回应称通用 API 设置合规,但需明确报告成本与配置。这本质上是关于“基准测试到底测模型还是测系统”的规则争论。

事件核心:发生了什么

7 月 30 日,OpenAI 公开表示其 GPT-5.6 Sol 模型在 ARC-AGI-3 逻辑推理基准上取得了 38.3% 的得分,高于 Anthropic Claude Opus 5 此前创下的 30.2%。但关键前提是,OpenAI 并未使用该基准的官方测试套件,而是通过自家 Responses API,并额外启用了两项设置:“Retained Reasoning”(保留模型在步骤间的推理链)和 “Compaction”(压缩旧上下文而非直接截断)。在官方标准测试环境中,GPT-5.6 Sol 的得分仅为 7.8%。

ARC 奖联合创始人 François Chollet 回应指出,需要区分两种测试方式:禁止使用“为破解基准而定制的”套件,但允许使用“面向所有 API 用户开放且非专门为 ARC-AGI-3 开发的”通用 API 设置。他承认 OpenAI 最终采用的设置确实合规,且强调只要成本和设置公开透明,不同提供商存在配置差异是可以接受的。

为什么重要

这场争论揭示了 AI 基准测试背后一个无法回避的结构性问题:基准分数从来不只是模型能力的反映,也包含了测试环境与 API 系统能力的贡献。OpenAI 主张“评估应包含系统级能力”,而 ARC Prize 则认为“应该尽可能剥离系统影响以衡量模型本身”。目前公开信息显示,双方的分歧集中在是否采用“专为基准适配的推理压缩”功能——这直接影响了模型在连续任务中的上下文利用效率。从行业竞争角度看,这意味着大模型厂商正在将“基准优势”竞争从模型参数扩展到了 API 产品设计和推理优化层面。

对用户/开发者/创作者的影响

对于使用 API 的开发者,这个事件的实际信号很明确:同一模型在开启推理链保留与上下文压缩后,性能表现可以相差数倍。如果你正在构建需要多轮逻辑推理或多步任务的应用,API 选型时除了关注模型版本,还需要仔细评估 SDK 或 API 配套的推理保留、上下文管理等系统功能。对于关注“哪个模型更强”的采购决策者,建议同时关注测试使用的设置是否与你实际应用场景一致。对普通用户而言,目前公开的 ARC-AGI-3 分数都不宜直接视为“模型智商排名”,官方标准化分数(7.8%)与自定义设置分数(38.3%)的巨大落差本身说明基准的解读需要更多上下文。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

第一,ARC Prize 是否会将“通用 API 设置”纳入正式的评测规则或评分分级标注,以避免未来出现类似的分数对比混乱。第二,开发者社区是否会基于此次争议形成一套“基准测试设置披露规范”,促使模型厂商在公布分数时同步说明 API 版本与优化开关的启用情况。第三,Claude Opus 5 或 Google Gemini 等其他巨头是否也拥有类似的专有推理优化开关,以及在开启后能否复现或超越 OpenAI 的这一分数。

来源:The Decoder AI News

celebrityanime
celebrityanime
文章: 15995

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注