Turns out GPT-5.6 Sol is actually SoTA on ARC-AGI-3. Just took two setting changes. You just have to allow it to reason and work over multiple context windows with the help of our canonical compaction implementation….

OpenAI 通过两个设置调整——允许模型跨多个上下文窗口推理并配合一种规范压缩方法——使 GPT-5.6 Sol 在 ARC-AGI-3 基准上达到了最先进水平(SoTA)。这项发现并非通过重新训练模型实现,而是在推理阶段优化了策略,揭示了大模型推理能力的潜在边界。

一句话看懂:OpenAI 通过两个设置调整——允许模型跨多个上下文窗口推理并配合一种规范压缩方法——使 GPT-5.6 Sol 在 ARC-AGI-3 基准上达到了最先进水平(SoTA)。这项发现并非通过重新训练模型实现,而是在推理阶段优化了策略,揭示了大模型推理能力的潜在边界。

事件核心:发生了什么

7 月 29 日,开发者 Thibault Sottiaux 在 X(原推特)上公开了一项发现:只需对 GPT-5.6 Sol 做两个设置变更——启用多上下文窗口推理并配合其“规范压缩实现”(canonical compaction implementation),就可使该模型在 ARC-AGI-3 评测上取得当前最佳结果(SoTA)。评论中的 Andrew Curran 补充解释,这项技术的底层概念是“Momento”。此前,业界普遍认为 GPT-5.6 Sol 在 ARC-AGI-3 上的表现有限,此次调整意外地证明了该模型本身的推理潜力远未被充分释放。

为什么重要

ARC-AGI 系列基准测试旨在衡量模型对全新视觉逻辑问题的泛化能力,通常被视为通往通用人工智能(AGI)的重要评估指标之一。GPT-5.6 Sol 此次在 ARC-AGI-3 上登顶,意味着通过优化推理策略(而非增大算力或训练数据)即可显著提升模型的抽象推理水平。这提示整个 AI 行业:当前闭源大模型的基础架构可能拥有比实践中更高的认知上限。对于 OpenAI 而言,这一发现强化了其模型在复杂推理赛道的竞争力;对于竞争对手和研究者来说,也指出了“推理架构优化”可能比“堆参数”更具性价比的新方向。

对用户/开发者/创作者的影响

普通用户: 如果类似的多上下文推理技术被集成到 ChatGPT 等产品中,用户可能会在解决复杂逻辑题、数学推理或多步骤任务时感受到更准确、更系统化的回答能力。
开发者/API 调用者: 目前公开信息显示,该“规范压缩实现”的具体接口和定价尚未发布。但一旦 OpenAI 将其纳入 API,开发者将能以更低的推理成本调用更接近 SoTA 的性能,尤其在需要深度推理的 AI 应用(如代码生成、科学分析、自动化决策)中收益明显。
内容创作者: 更强的推理能力可能使 AI 在剧情设计、结构化内容生成、甚至拼贴式创意工作中表现得更加连贯且符合逻辑。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

1. 开放时机: OpenAI 是否会通过官方博客或更新日志公布具体的配置参数和部署计划?这关系到开发者能否立即复现这一结果。
2. 定价策略: 多上下文推理可能增加 Token 消耗量,如果 API 定价因此调整,会直接影响应用开发者的成本模型。
3. 竞品跟进: Google、Anthropic 等厂商是否会快速在自身旗舰模型(如 Gemini、Claude)上尝试类似的多窗口推理或压缩方案?这将决定下一轮推理性能竞争的主战场是训练还是推理优化。

来源:Follow Builders · X · Thibault Sottiaux

celebrityanime
celebrityanime
文章: 16005

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注