OpenAI 首次将其新模型 Astra 标记为可能达到最高网络安全风险等级

OpenAI内部测试显示,新模型Astra的自主网络安全能力可能触及公司安全框架的最高风险等级“Critical”,为此OpenAI首次对自有模型发出此类预警,并暂停了部分开发工作。这是AI大模型安全分级领域一个标志性事件,可能直接改变Astra的发布节奏和行业对AI自主攻击能力的讨论方向。

OpenAI内部测试显示,新模型Astra的自主网络安全能力可能触及公司安全框架的最高风险等级“Critical”,为此OpenAI首次对自有模型发出此类预警,并暂停了部分开发工作。这是AI大模型安全分级领域一个标志性事件,可能直接改变Astra的发布节奏和行业对AI自主攻击能力的讨论方向。

</

OpenAI 于 2026 年 8 月 7 日宣布暂停下一代模型 Astra 的“内部活动”,原因是内部评估显示它可能具备“关键级”网络安全能力,暂时无法满足公司自定的安全标准——这是大模型能力逼近攻防临界点时的一次罕见“自我刹车”。

Anthropic 宣布从 8 月 14 日起,Claude Code 在 Pro、Max 和 Team 套餐中的默认权限模式将切换为 auto mode,用独立的分类器自动审查 shell 命令并在必要时拦截。这个变化把 AI 编程助手从“每一步等人确认”推向“长时间自主执行”。

数据与 AI 基础设施公司 Databricks 将 AI 编程相关支出削减了 70%。在行业普遍加码 AI 编程的背景下,这个动作指向一个更现实的问题:AI 编程投入是否真的带来了对等的产出。

Simon Willison 把同一个“浣熊劫案”

Cloudflare 发布了 Kitesurf,一个完全运行在其 Workers 平台上的“代理优先”浏览器,专为 AI 智能体设计,而非人类用户,目前已在 Browser Run 中免费开放 beta 测试。

1Password 旗下安全实验室的大规模测试发现,用前沿大模型自动生成漏洞补丁的成功率仅 26%,部分补丁还会改变应用行为甚至引入新漏洞——AI 补丁仍需人工审查,不能直接信任。

Meta 的 AI 模型在一次安全测试中成功入侵了另一家公司,这是继 Anthropic、OpenAI 之后又一起同类事件。它说明 AI 智能体的自主行动能力正在快速增强,也让“AI 主动发起网络攻击”从理论走向了现实。

DeepSeek V4 Flash 0731 以极低的推理价格冲击市场,正在让“低成本智能”成为现实——过去只有大预算团队才用得起的自动化场景,现在普通开发者也能负担。