一句话看懂:OpenAI 于 2026 年 9 月 3 日发布新一代大模型 GPT-6 Astra,在 ARC-AGI 3 基准上取得 99.9% 的惊人得分,同时以与 Claude Fable 5 相同的 API 定价直接对标 Anthropic 旗舰模型,AI 大模型竞争进入新阶段。
事件核心:发生了什么
9 月 3 日,OpenAI 宣布 GPT-6 Astra 开始向部分组织开放,随后几天将陆续覆盖所有 ChatGPT Plus、Pro、Business 和企业用户,同时通过 OpenAI API 和 AWS 提供服务。API 定价为每百万输入 token 10 美元、每百万输出 token 50 美元,与 Anthropic 的 Claude Fable 5 和 5.1 完全一致,OpenAI 显然将 Astra 定位为 Fable 的直接竞品。
最受关注的数据来自今年 3 月发布的 ARC-AGI 3 基准:Astra 在使用 OpenAI 自定义的 “Provider Adapter harness” 时得分高达 99.9%,成本约 1.9 万美元。不过需要指出的是,如果使用默认的 ARC-AGI harness,得分仅为 62.7%,成本约 2.6 万美元。两种测试方式的最大区别在于 Provider Adapter 能在请求之间保留不透明的推理状态,并使用压缩技术处理更长对话,让模型可以复用之前的工作成果。值得注意的是,Claude Fable 5 至今尚未公布在该基准上的成绩。
为什么重要
这次发布的意义体现在三个层面。第一,ARC-AGI 3 的高分尽管存在测试方式争议,但 99.9% 与 62.7% 的差距本身说明推理状态保留对复杂任务的影响远超预期,这为行业重新审视基准测试方法提供了案例。第二,这是 OpenAI 首次以完全对标竞争对手的价格体系发布旗舰模型,大模型 API 的价格战正式进入同价竞争阶段,OpenAI 不再仅靠模型能力溢价,而是直接比拼同等价格下的性能差异。第三,Astra 在安全任务上表现突出——ExploitBench 得分 100%(此前 GPT-5.6 Sol 为 78.5%),ExploitGym 得分 42.4%(Sol 为 30.3%),二进制逆向工程 SRE-Bench 四次尝试内得分 99.2%(Sol 为 68.7%)——呼应了此前 Hugging Face 安全事件后市场对模型攻防能力的高度关注。
不过 Astra 并非全面领先。Artificial Analysis 的 Intelligence Index 显示,Astra 得分 61,与 GPT-5.6 Sol 持平,落后于 Claude Fable 5.1(启用 fallback 的最高得分),也低于 Meta 新发布的 Muse Spark 1.3。在 Coding Agent Index 上 Astra 则表现更优:最高努力模式下,比 Sol 高 2 分,单任务成本不到 Claude Fable 5 的一半。OpenAI 自家基准还显示,Astra 在 256K–512K token 长度的八针测试中取得 100% 准确率,512K–1M token 区间仍有 96.3%,长上下文处理能力有显著改善。
对用户/开发者/创作者的影响
对开发者而言,同样的 API 价格意味着可以直接用 Astra 替换 Fable 而无需调整预算,具体选型取决于实际任务类型:编码智能体场景 Astra 性价比突出,纯推理智能指数仍落后 Fable 5.1。对企业用户来说,Astra 在漏洞利用和逆向工程上的高分意味着安全测试、红队演练类工作负载有了新的选择,但需要注意的是高分依赖于 OpenAI 自定义的 Provider Adapter harness,企业是否能在自己的部署环境中复现同等效果,目前公开信息尚不明确。对普通 ChatGPT 用户,Astra 的长上下文能力提升最直接可感,处理超长文档或复杂对话时体验应有明显改善。API 模型标识为 gpt-6-astra,开发者在模型列表中即可识别。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
接下来有几个具体观察点:第一,ARC-AGI 团队是否会针对 Provider Adapter harness 的方法论做出回应或调整评分标准,以及 Anthropic 是否公布 Fable 5 在该基准上的成绩——这直接关系到 Astra 的 99.9% 是否被行业广泛采信。第二,Astra 全面开放后,实际开发者评测(而非厂商自报基准)中的表现是否与官方数据一致,尤其是长上下文能力和编码智能体在真实工作流中的稳定性。第三,OpenAI 是否会将该推理状态保留能力扩展为标准化 API 功能,如果其他模型也能调用类似机制,ARC-AGI 类的基准测试方式可能需要整体重新设计。


