一句话看懂:OpenAI发现,只需在ARC-AGI-3基准测试中启用“保留推理”和“压缩”两个API设置,GPT-5.6 Sol的得分就从13.3%跃升至38.3%,输出token减少6倍。说明当前模型在抽象推理任务上的真实能力可能被评测框架的设计缺陷严重低估。
事件核心:发生了什么
2026年7月29日,OpenAI发布研究称,其最新模型GPT-5.6 Sol在ARC-AGI-3基准(一种2D拼图游戏类智能测试)的公开集上,官方评测器下得分仅13.3%。通过改用与ChatGPT和Codex生产环境一致的Responses API,并启用两项参数——保留推理链(retained reasoning)和上下文压缩(compaction),模型得分提升至38.3%,而人类测试者平均得分为48%。此前GPT-5.5在该基准上仅得0.4%。评测日志显示,原官方框架在每次动作后丢弃了模型的完整思考过程,并使用滚动截断窗口导致早期动作丢失,这两点严重限制了模型的持续学习能力。
为什么重要
ARC-AGI-3原设计者有意采用通用框架以暴露模型短板并保证公平。但OpenAI实际测试揭示,这一“公平”框架反而制造了不公平——它忽略了模型训练和部署时实际依赖的推理记忆机制。这意味着当前AI基准评测成绩可能系统性低估了主流商业模型在抽象推理上的表现。该发现直接冲击了“前沿模型无法泛化解决新游戏”的普遍认知,并促使业界重新审视评测框架与模型能力之间的鸿沟。对于模型提供商,这提醒API设计和调用方式本身已成为影响能力评估的关键变量。
对用户/开发者/创作者的影响
对使用API构建AI Agent的开发者而言,应特别注意保持推理上下文连续性,而非仅保留动作日志。OpenAI的Responses API已内置自动保留推理消息与压缩长上下文的功能,开发者在类似任务(如游戏、迷宫求解、组合规划)中应优先使用此类原生支持,而非自行裁剪对话历史。对于内容创作者,该案例表明模型在复杂序列推理任务上的表现高度依赖工具链配置,评测结果不应被简单视为模型能力的绝对标尺。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
1. ARC-AGI-3主办方是否将根据此发现更新官方评测框架,或引入“保留推理”作为可选模式?2. 其他模型(如GPT-5.5、Claude、Gemini)能否通过类似配置在该基准上获得提升?3. 该发现是否会推动AI基准评测向“生产环境对齐”方向演进,即更注重反映模型在实际部署中的真实表现,而非隔离条件。
来源:OpenAI News


