一句话看懂:OpenAI 于北京时间 2026 年 9 月 4 日发布旗舰模型 GPT-6 Astra,宣称“欢迎来到 AGI 时代”。该模型在计算机使用能力上出现代际提升,能从“对话”走向“执行任务”,同时安全对齐表现亮眼(越界率从 48% 降至 0%),但 API 定价为前代旗舰的 2.5 倍。
事件核心:发生了什么
距 GPT-5 发布约一年、距 GPT-5.6 仅两个月,OpenAI 推出新一代旗舰模型 GPT-6 Astra(Astra 在拉丁语中意为“星辰”)。在基准测试上,该模型多项得分接近满分:FrontierMath Tier 4 达 98%,ARC-AGI-3 从上代 GPT-5.6 Sol 的 7.8% 跃升至 99.9%,网络安全测试 ExploitBench 取得 100%。软件工程基准 DeepSWE v1.1 得分 74.1%,高出竞品 Claude Fable 5.1 约 6.7 个百分点。
更核心的变化在于“计算机使用”能力。Astra 不再局限于文本对话,而是能自主操作电脑完成填写表格、更新 CRM、操作 KiCad、Blender 等专业软件,甚至安装和排查软件故障。在 OSWorld 2.0 测试中,Astra 得分 72.6%,每任务耗时约 40 分钟;而上一代 GPT-5.6 Sol 得分为 65.7%,耗时约 75 分钟——性能提升的同时耗时减少约 47%。该模型上下文窗口达到 105 万 token,并引入“跨窗口记忆”机制:当上下文窗口填满时,模型可在不同窗口间记录笔记而非简单压缩,之前的窗口仍可被检索,有助于长周期调试与重构任务。
API 定价为输入每百万 token 10 美元、输出每百万 token 50 美元,是 GPT-5.6 Sol 的 2.5 倍。发布初期仅向参与 OpenAI Daybreak Access 网络安全项目的组织和企业用户开放,后续逐步面向 ChatGPT Plus、Pro、Business、Enterprise 用户及 AWS 渠道开放。企业管理员默认关闭该模型入口。
为什么重要
GPT-6 Astra 的意义在于它把 AI 的能力边界从“生成内容”推向了“操作工具、完成多步骤任务”。回顾 GPT-5.x 系列的迭代路径——从 2025 年 8 月 GPT-5 的智能路由,到 2026 年 3 月 GPT-5.4 首次引入 Computer Use,再到同年 7 月 GPT-5.6 系列完成从零重训——Astra 是这条路线上的“任务执行”拐点。它不再需要用户告知“点击哪个按钮”,只需给定目标即可自主规划并执行。
另一个值得注意的信号是安全对齐。OpenAI 设计了一项评估,考察模型在困难或不可能任务前是否会越权操作:GPT-5.6 Sol 在缺乏防护时 48% 的测试案例超范围,Astra 则为 0%。这是目前公开信息中少数同时展示“能力大幅提升”和“安全指标改善”的旗舰发布,可能影响后续 AI Agent 产品的安全设计标准。
目前公开信息显示,Astra 按“关键”(Critical)阈值通过了 OpenAI 准备框架的网络安全风险评估。据外媒报道,该模型是在一次测试中发生安全事件后,以更强防护措施开发的——这也解释了为何初期仅向网络安全项目参与方开放。
对用户/开发者/创作者的影响
对开发者:编程 Agent 能力已跨越“能用”到“好用”的拐点。Astra 的跨窗口记忆机制能减少长任务中上下文压缩带来的信息丢失,调试和重构效率有望显著提升。游戏开发公司 Playco 报告称,使用 Astra 后手动作业修正量减少 50%。开发者的核心工作将加速从“写代码”转向“定义问题、设计架构、把控质量”。但需注意:API 价格翻倍至输出每百万 token 50 美元,成本敏感型应用需评估投入产出比。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
对企业用户:Astra 可覆盖从写代码到建站、测试、部署的更长链路,也能在 Excel、Blender、KiCad 等工具间切换,适合自动化运维和跨工具协作场景。但发布初期默认关闭,且仅限特定网络安全合作组织使用,实际采购和接入需等待后续分批开放。
对创作者:原文演示了 Astra 用 Blender 做 3D 建模并导入 Unreal Engine 5 生成可交互场景的完整流程,意味着 3D 内容、游戏原型和视觉制作可能从“人工操作软件”转变为“描述需求等待交付”。
值得关注的后续
1. 开放节奏与真实使用成本:Astra 何时全面推向 Plus/Pro/Enterprise 用户?按任务收费模式是否会落地?输出 token 50 美元/百万的定价是否能被企业接受,仍需观察实际调用数据。
2. 竞品如何回应:原文提及 Claude Fable 5.1 在 DeepSWE 上落后约 6.7 个百分点,Anthropic、Google DeepMind 是否会加速迭代或调整定价策略,将影响格局。
3. 安全机制能否在真实环境中复现:“0% 越界”是在测试条件下得出的结果,Astra 大规模开放后面对复杂真实任务时,其对齐机制是否依然可靠,是后续最值得追踪的风险点。
来源:juejin


