OpenAI says using its Responses API harness with GPT-5.6 Sol tripled its ARC-AGI-3 score and used fewer tokens, after Sol with the official harness scored 7.8% (OpenAI)

OpenAI 通过其 Responses API 的调用框架(harness)与 GPT-5.6 Sol 模型搭配,在 ARC-AGI-3 基准测试上将得分从 7.8% 提升至约 23.4%(即翻了三倍),同时使用的 token 更少。这表明 API 层面的调用策略对模型实际推理效果影响巨大,而不仅是模型本身…

一句话看懂:OpenAI 通过其 Responses API 的调用框架(harness)与 GPT-5.6 Sol 模型搭配,在 ARC-AGI-3 基准测试上将得分从 7.8% 提升至约 23.4%(即翻了三倍),同时使用的 token 更少。这表明 API 层面的调用策略对模型实际推理效果影响巨大,而不仅是模型本身的能力。

事件核心:发生了什么

根据 OpenAI 公布的信息,其 GPT-5.6 Sol 模型在官方标准 harness(调用框架)下,ARC-AGI-3 得分仅为 7.8%。当换用 OpenAI 自有的 Responses API 所对应的 harness 后,同一模型的得分直接翻了三倍,并且消耗的 token 数量反而更少。ARC-AGI-3 是衡量模型抽象推理与泛化能力的高难度基准,通常被认为是向 AGI 迈进的关键测试之一。此次提升并非来自模型参数或训练数据的改动,而是完全基于 API 调用层的“搭桥”优化。

为什么重要

这一结果直接挑战了“模型能力完全由预训练决定”的主流认知。它揭示了推理阶段的“调用架构”(包括提示策略、上下文窗口管理、多步推理编排等)能显著放大或抑制模型的真实表现。对于 AI 行业而言,这意味着 API 产品设计可能成为新的竞争壁垒——谁能提供更高效的 harness,谁就能在不升级模型的情况下让用户获得更优结果。同时,这也降低了模型迭代对算力的依赖:通过改进调用方式,现有模型仍有大量未被挖掘的潜力。

对用户/开发者/创作者的影响

对开发者来说,这一发现意味着单纯比较模型分数已不足以判断实际效果,选对 API 调用框架比选模型本身更关键。如果你正在使用 OpenAI 的 GPT-5.6 Sol,建议优先采用 Responses API 而非旧版 completion 接口,实测可能带来数倍性能提升。对普通用户而言,未来基于同一模型的不同聊天或自动化工具可能会表现出截然不同的能力,软件层面的优化将成为产品差异化的核心。创作者(如 AI 原生应用团队)应关注 OpenAI 是否公开其 harness 的具体设计,以便自行复现同样的增益。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

目前公开信息显示,OpenAI 尚未详细披露 Responses API harness 的内部工作机制。值得跟踪的要点包括:1)该 harness 是否仅适用于 ARC-AGI-3 任务,还是能泛化到代码生成、多模态推理等其他基准;2)其他模型(如 GPT-5.6 非 Sol 版本)是否也能通过同一调用策略获得显著提升;3)竞品 Anthropic 或 Google 是否会跟进推出类似“API 级推理优化”方案,从而将竞争从模型层扩展到接口层。此外,OpenAI 是否会提高 Responses API 的定价也需要关注——更低的 token 消耗与更高的得分并存,可能促使更多用户迁移到新框架。

来源:Techmeme

celebrityanime
celebrityanime
文章: 16027

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注