一句话看懂:OpenAI 于 2026 年 9 月推出新一代电脑操作智能体 GPT-6 Astra,能在电脑上自动完成看屏幕、点鼠标、跨软件填表和调试代码等任务。相比前代 GPT-5.6 Sol,它在多个自动化基准上的表现近乎翻倍,意味着 AI 从“聊天建议”正式走向“替你干活”。
事件核心:发生了什么
9 月 4 日,OpenAI 正式发布 GPT-6 Astra。据公开信息,这一代模型被定位为真正的“电脑操作员”:它可以接管屏幕、模拟鼠标键盘操作,并在不同软件间切换,连续完成填表、整理 CRM、查询资料、修改网页、排查代码 Bug 等完整工作流,而不是像前代模型那样只在对话框里输出文字建议。
在性能数据上,OpenAI 展示了三组基准测试结果:在 OSWorld 2.0(电脑操作测试)中,Astra 得分 72.6%,而 GPT-5.6 Sol 的得分是 65.7%;关键差异在速度——Astra 完成一项任务平均约 40 分钟,而 Sol 需要约 75 分钟,效率提升接近一倍。在 AutomationBench(跨软件多步业务流程自动化测试)中,Astra 得分 41.4%,Sol 仅 18.1%,差距明显,说明 Astra 在真实办公环境的复杂长链路任务上具备更强的规划与执行能力。
在代码专项测试 Terminal-Bench 4.0(终端命令行操作测试)中,Astra 得到 57.9%,Sol 是 37.3%。Astra 不再只是补几行代码的辅助工具,而是能够自行搭建环境、运行终端命令、测试网页并持续修正直至项目真正可运行。
为什么重要
GPT-6 Astra 的升级核心不是在语言理解或图像生成层面继续堆参数,而是打通了“看界面—做决策—执行操作”的完整闭环。这条技术路线虽然仍处于早期,但它是 AI 能力与真实数字办公世界之间最直接的接口:过去大模型擅长生成内容,但无法操作系统;Astra 让模型从“内容生成器”延伸到“业务流程执行器”。
从竞争格局看,Astra 的 AutomationBench 得分(41.4%)比 GPT-5.6 Sol(18.1%)高出一倍多,同时在处理速度上具备明显优势,这意味着 AI 智能体与人工远程操作之间的替代关系不再停留在概念验证,而开始触及企业真正愿意付费的日常重复劳动场景。对目前的办公自动化与 RPA(机器人流程自动化)软件市场来说,大模型原生操作电脑的能力将构成一种新的技术范式冲击。
对用户/开发者/创作者的影响
对普通办公用户而言,GPT-6 Astra 的价值最直观:它能把“手动复制数据填进系统、在多软件间来回切换整理文件”这类碎片化工作交给 AI 连续执行。官方演示中 Astra 会沿用公司原有文档模板的版式和语气,降低交付物“一眼 AI”的特征,意味着报表、PPT 和跨应用邮件往来的前期工作可以被压缩。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
对开发者来说,Astra 的终端操作能力(57.9% 的 Terminal-Bench 得分)意味着它有能力参与更完整的开发任务,例如从初始化项目到运行测试并修复报错。开发者可以将其视为一个“能执行命令的助手”,而非仅能生成代码片段的文本工具。
对企业 IT 与采购决策者而言,需要关注的不仅是模型能力,还涉及权限安全与操作审计——当一个 AI 可以自主点击屏幕并跨系统操作时,企业必须评估现有的账户权限体系、危险操作拦截方案以及 AI 行为日志是否能同步跟上。目前公开信息尚未披露 Astra 在权限管控层面的技术细节。
值得关注的后续
第一,定价与开放入口。目前 OpenAI 尚未公布 GPT-6 Astra 的具体 API 定价与消费级/企业级订阅方案,价格策略将直接影响它从“评测高分”落到“真金白银的企业采购”的速度。
第二,实际操作的安全边界。Astra 能够连续执行长达约 40 分钟的操作流程,随着任务变长,误操作累积风险也会上升。后续产品是否引入更细粒度的“人在回路”确认机制,以及错误执行后的回滚能力,值得持续观察。
第三,竞品与开发者生态的跟进。在 Anthropic 的 Claude 以及国内头部厂商相继推出屏幕操作与智能体功能后,GPT-6 Astra 的高基准分数能否转化为可复现的真实用户体验,尤其是否获得主流软件厂商的底层接口配合,是决定其生态落地的关键变量。


