OpenAI 发布 GPT-6 Astra,多项基准达到 SOTA

OpenAI 发布 GPT-6 Astra,在数学推理、通用智能体与科学发现等多类基准测试中达到 SOTA,并首次将“计算机使用”能力带入 ChatGPT 桌面端,标志着大模型从“生成内容”向“替你操作电脑”的智能体方向再推进一步。

一句话看懂:OpenAI 发布 GPT-6 Astra,在数学推理、通用智能体与科学发现等多类基准测试中达到 SOTA,并首次将“计算机使用”能力带入 ChatGPT 桌面端,标志着大模型从“生成内容”向“替你操作电脑”的智能体方向再推进一步。

事件核心:发生了什么

9 月 3 日,OpenAI 官方账号及研究员 Sherwin Wu 通过 X 平台披露了 GPT-6 Astra 的发布信息。根据 OpenAI 公布的评估结果,GPT-6 Astra 在 FrontierMath Tier 4、ARC-AGI 3 和 TerminalBench-4.0 三项测试中均达到当前最优水平;在科学发现方向,该模型在 Terminal-Bench Science 0.1 和 HealthBench Pro 上也刷新了纪录。值得注意的细节是,OpenAI 并未停留在基准分数这一维度,而是强调 GPT-6 Astra 在 ChatGPT 桌面应用中首次实现了“计算机使用”(computer use)功能。研究员 Sherwin Wu 的公开评价为“这是最令人震撼的部分”,意味着用户可以直接在桌面端让模型操作当前界面完成多步骤任务,而不是仅仅在对话框里输出文本。

为什么重要

这次发布的意义在于两点。第一,从技术路线看,GPT-6 Astra 同时覆盖了“最难数学推理”和“智能体执行”两条线,它在 ARC-AGI 3 和 TerminalBench-4.0 上的表现说明模型不仅要“想得对”,还要“做得到”,这对后续 Agent 类应用是基础性能力。第二,把计算机使用能力放进桌面客户端而不是只开放 API,说明 OpenAI 正尝试把大模型从云端问答工具变成用户本机操作系统的交互层,这会直接影响未来 PC 端的工作流形态,也会给依赖传统图形界面交互的软件生态带来压力。对于整个行业而言,闭源模型在科学发现类基准(如 HealthBench Pro)上的领先,也再次拉高了大模型在垂直科研场景中的能力门槛。

对用户/开发者/创作者的影响

对普通桌面端用户来说,最直观的变化是可以通过 ChatGPT 桌面应用让 Astra 接管部分鼠标键盘操作,完成诸如整理本地文件、跨应用填写表格、按指令执行重复性任务等工作,这会显著降低使用 AI 的操作成本。对开发者而言,需要留意的是 GPT-6 Astra 的“计算机使用”能力是否随 API 开放,以及 TerminalBench 类任务的能力是否能被移植到云端虚拟机环境中,这将决定未来 Agent 工具链的构建方式。对创作者和科研工作者,新模型在科学发现与专业推理上的领先意味着更复杂的文献分析、实验设计辅助和数据处理可以由模型直接承担,而不是停留在创意文案层面。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

目前公开信息显示,GPT-6 Astra 的具体发布时间、定价策略以及 API 开放范围尚不明确,值得关注三点:一是“计算机使用”功能是否向免费用户或 Plus 用户分层开放,二是 TerminalBench 与 HealthBench 上的成绩能否转化为可复现的企业级产品,而非停留在评估阶段;三是谷歌、Anthropic 等竞品是否会在下个版本中针对“桌面操作”这一场景快速跟进。如果桌面端智能体被验证是高频需求,Windows 与 macOS 上的原生软件分发逻辑和 SaaS 产品形态都可能被重新审视。

来源:X:Sherwin Wu(@sherwinwu)

celebrityanime
celebrityanime
文章: 22199

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注