OpenAI 首次将其新模型 Astra 标记为可能达到最高网络安全风险等级

OpenAI内部测试显示,新模型Astra的自主网络安全能力可能触及公司安全框架的最高风险等级“Critical”,为此OpenAI首次对自有模型发出此类预警,并暂停了部分开发工作。这是AI大模型安全分级领域一个标志性事件,可能直接改变Astra的发布节奏和行业对AI自主攻击能力的讨论方向。

一句话看懂:OpenAI内部测试显示,新模型Astra的自主网络安全能力可能触及公司安全框架的最高风险等级“Critical”,为此OpenAI首次对自有模型发出此类预警,并暂停了部分开发工作。这是AI大模型安全分级领域一个标志性事件,可能直接改变Astra的发布节奏和行业对AI自主攻击能力的讨论方向。

事件核心:发生了什么

OpenAI在8月7日发布声明,称“过去几天”对即将推出的Astra模型进行内部评估时,发现其在智能体编程和网络安全能力上出现“显著进步”,以至于公司“无法排除Critical能力等级”——也就是OpenAI安全框架“Preparedness Framework”中的最高风险级别。这是OpenAI首次将自家模型标记为可能达到这一等级;此前包括GPT-5.6-Sol在内的模型,最高只被评为“High”。

作为响应,OpenAI已暂停Astra部分不符合最新安全要求的开发活动,同时部署了隔离测试环境、限制网络和工具访问、增强模型权重加密保护,并引入自动监测系统来阻止高风险行为。OpenAI还特别澄清,Astra与此前公开的Hugging Face漏洞事件无关。

为什么重要

在OpenAI的Preparedness Framework中,“Critical”意味着模型能在无人干预的情况下,独立发现并利用各严重级别的零日漏洞,或者在只给定高层次目标时,自主设计并执行针对受保护目标的端到端网络攻击。若Astra确实达到这一水平,它就不再是常规的辅助工具,而是具备自主攻击能力的智能体——无论是防御方还是攻击方,其潜在影响都远超此前的“High”等级模型。

这次预警发生在行业激烈争论AI是否具备自主网络攻击能力的关键时期,OpenAI主动承认“无法排除”最高风险,必然强化监管机构对AI安全审查的要求,也会推动竞争对手重新评估各自的模型安全分级标准。不过也有批评者认为,这更像一次“恐惧营销”:OpenAI只报告“潜在”等级,并未确认,如果最终没有实锤,它既赚了公关声量,又可能为“模型太危险不能发布”制造新叙事。

对用户/开发者/创作者的影响

对普通用户而言,最直接的影响可能是Astra的发布计划被打乱——此前有传闻称该模型最快下周上线,如今OpenAI已经暂停部分开发,短期内能否按原计划推出存在变数。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对开发者和企业客户来说,这件事释放了更明确的信号:调用大模型API时,不能只关注能力上限,还要关注供应商的安全控制和分级机制。尤其是企业若计划让智能体自主执行代码、操作网络或访问敏感系统,需要建立独立监控和熔断机制,而不仅是依赖模型自身的安全训练。对于依赖OpenAI生态的开发者,Astra若因安全门槛而延期或限制能力,会影响产品迭代路线,应提前评估备选方案。

值得关注的后续

后续有三个观察点:第一,Astra是否会按传闻下周发布,还是因为安全审查而延期;第二,OpenAI最终是否会正式给出“Critical”评级,以及会披露哪些测试证据;第三,其他大模型厂商是否会跟进类似的安全分级,并重新评估自家模型在自主攻击方面的潜力。这些变化将直接影响AI安全标准的制定,以及“能力越强、限制越多”是否成为行业常态。

来源:The Decoder AI News

celebrityanime
celebrityanime
文章: 18313

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注