一句话看懂:OpenAI 的 GPT-6 Astra 通过新增的 Provider Adapter harness,在 ARC-AGI-3 半私密评测中拿下 99.95% 的高推理得分,远超标准 harness 的 62.7%,显示评测框架本身对模型能力的释放有了决定性的影响。
事件核心:发生了什么
根据 ARC Prize 官网 9 月 2 日公布的数据,OpenAI GPT-6 Astra 在 ARC-AGI-3 Semi-Private 评测中的成绩出现巨大分化。在标准 harness(允许模型在环境中携带笔记)下,最高推理级别的得分为 62.7%,对应成本 26,098 美元;而切换到 Provider Adapter harness(在请求之间保留不透明的推理状态,并用压缩延续长对话,使模型能复用先前工作)后,高推理得分跃升至 99.95%,成本反而降至 18,817 美元。在公开演示的 25 个环境中,Provider Adapter 模式下几乎所有环境都达到 100% 通过率,而标准模式在部分复杂游戏环境(如 G50T、TU93、BP35)上得分极低甚至为零。
为什么重要
这一结果并非单纯展示模型能力上限,而是强调评测基础设施对结果的关键塑形作用。GPT-6 Astra 在 ARC-AGI-1 和 ARC-AGI-2 上得分接近满分(98.5%),但 ARC-AGI-3 的设计显然更具挑战性——它不再只考验一次性推理,而是考验模型在长程任务中维持思路一致性的能力。Provider Adapter harness 的价值在于让模型具备“工作记忆”:把推理过程中的中间状态保留下来,跨请求复用,这解决了多轮协作和大型环境探索中的核心痛点。对行业而言,这提示模型评测基准的公平性和扩展性正在成为新的竞争焦点,同时也表明推理成本的优化不一定以牺牲性能为代价——更高效的框架反而能以更低成本获得更高分数。
对用户/开发者/创作者的影响
对使用 API 的开发者来说,是否支持 Provider Adapter 式的状态保持,将直接影响在复杂任务中(如代码生成、数据分析、代理式工作流)的实际效果。标准模式下的模型表现更像“一次性解答者”,而配备状态保持机制的模型才适合需要持续上下文的任务。对于企业采购而言,ARC-AGI-3 的得分差距提醒买家不应只看模型型号,还应关注推理服务的调用方式与对话管理能力。对独立开发者和研究者,这套 harness 暴露了模型长程推理能力的另一层瓶颈——模型可能本来具备解决问题的知识,但在缺乏持久工作空间的环境中被严重低估。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
首先,OpenAI 是否会将该 Provider Adapter 能力作为标准 API 功能对外开放,还是仅限特定内部或企业场景;其次,其他模型厂商(如 Anthropic 的 Claude 系列、Google 的 Gemini 系列)是否会跟进类似的状态保持 harness,重构自己的评测与部署方案;第三,ARC Prize 是否会针对 harness 带来的性能差异调整评测规则,例如统一限定推理状态的使用方式,以免榜单被框架工程能力而非模型智能主导。


