OpenAI 发布适用于编程和计算机应用的 GPT-6 Astra

OpenAI 发布 GPT-6 Astra,把大模型能力从"生成回答"推进到"直接在软件里执行多步骤任务",并首次因网络安全能力被自家 Preparedness Framework 列为"关键"级别。它既是一次产品迭代,也是一次风险等级的上调。

一句话看懂:OpenAI 发布 GPT-6 Astra,把大模型能力从”生成回答”推进到”直接在软件里执行多步骤任务”,并首次因网络安全能力被自家 Preparedness Framework 列为”关键”级别。它既是一次产品迭代,也是一次风险等级的上调。

事件核心:发生了什么

OpenAI 推出 GPT-6 Astra,定位覆盖编程、计算机操作、专业工作流、科学研究和网络安全。发布初期仅面向部分组织,随后逐步开放给 ChatGPT Plus、Pro、Business、Enterprise 用户,以及 OpenAI API、Microsoft Azure 和 AWS Bedrock。

Astra 能操作图形界面:填表单、更新 CRM、做调研、建网站、分析数据、安装测试软件,并排查屏幕上可见的问题。OpenAI 公布的数据显示,OSWorld 2.0 得分 72.6%(GPT-5.6 Sol 为 65.7%);编程方面 Terminal-Bench 4.0 得分 57.9%,DeepSWE v1.1 得分 74.1%。Codex 中引入实验性上下文机制,智能体可在不同上下文窗口间保留笔记,旧窗口仍可检索。长上下文支持 100 万令牌,MRCR 在 512K 至 1M 区间得分 96.3%。幻觉率为 4.2%,低于前代的 12.2%。

网络安全是本次最大的变化:Astra 是 OpenAI 首个被归为”关键网络安全能力”级的模型。在未启用生产防护的测试中,它发现并利用了此前未知的两个漏洞,还展示了对强化浏览器和操作系统开发利用程序的能力。生产版本限制了高级攻击任务,OpenAI 计划通过 Daybreak 计划释放防御能力。

为什么重要

这标志着头部模型的竞争重心从”对话质量”转向”任务执行能力”。Astra 让大模型开始接管真实软件流程,这直接触及企业自动化、RPA 和智能体赛道。同时,竞品格局并非一边倒:Humanity’s Last Exam 中 Claude Fable 5.1 得分更高,Gemini 3.8 Flash 支持原生视频和音频输入,而 Astra 目前不支持。此外,黄仁勋提到 Astra 在超 10 万块 NVIDIA Grace Blackwell NVLink72 上训练完成,并称后续将有 40 万块 GPU 投入使用——算力规模仍是这类模型的门槛。

对用户/开发者/创作者的影响

对开发者,Codex 的跨窗口上下文机制意味着长时间运行的任务可以回溯早期需求和测试结果,但对 API 成本与延迟的实测仍需等待。对企业用户,Astra 目前公开信息显示更适合流程自动化、CRM 维护、数据科学和数据库迁移等场景,采购前应确认生产版本对高级攻击任务的限制范围。对创作者,图像生成和音视频原生能力并非本次重点,短视频、音频类内容工作流短期内不一定受益。安全团队则需重新评估:一个能自主发现并利用漏洞的模型,即使有防护限制,也会改变攻防节奏。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是生产版本的安全限制是否足够、Daybreak 计划如何落地防御能力;二是 OpenAI 提到 Astra 的书面推理比前代更难监控,可监控性问题会否影响企业合规采用;三是竞品是否跟进”计算机使用”能力,以及 Astra 与 Claude、Gemini 的分工格局如何演变。

来源:InfoQ CN

celebrityanime
celebrityanime
文章: 23561

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注