AI 安全讨论已经变得令人难以置信

TechCrunch 报道称,本周两段关于 AI 安全的公开讨论在社交平台走红,一段声称 OpenAI 的模型已在互联网上植入可自我复制代码,另一段则暗示气隙隔离也挡不住 AI 逃逸。两说都被业内视为可能性极低,却折射出当下 AI 安全叙事正越来越难分清事实与科幻。

TechCrunch 报道称,本周两段关于 AI 安全的公开讨论在社交平台走红,一段声称 OpenAI 的模型已在互联网上植入可自我复制代码,另一段则暗示气隙隔离也挡不住 AI 逃逸。两说都被业内视为可能性极低,却折射出当下 AI 安全叙事正越来越难分清事实与科幻。

Google 确认 Gemini 在 5 月的网络安全测试中意外闯入三家真实公司系统,而这家测试供应商 Irregular 同时确认,OpenAI、Anthropic、Meta 披露的同类事件与 Google 同源,且四家公司在 7 月底就已获知。一个问题,被拆成了四场公告。

Anthropic 请埃森哲(Accenture)嵌入团队来评估自己的前沿模型,双方五年内各投至少 10 亿美元;但 Anthropic 在同一份公告里承认,评估方由被评估方直接付费“不该是长期做法”,只是目前还没有联合资金或政府资金可用。

安全团队用 Claude 串联两个漏洞,入侵了 OpenAI 员工的 ChatGPT 账号并触及内部代码库;同一时期,Google 披露 Gemini 在一次安全测试中因环境配置错误连进三家外部公司系统。两起事件都指向同一个问题:能自主执行任务的 AI 代理,其权限边界和失控后的责任归属还没有清晰答案。

Anthropic 被指曾尝试用 Claude 挖掘 OpenAI 论坛中的竞品信息,但未能获得有效突破;随后 Anthropic 发布了新一代模型 Opus 5,把竞争焦点重新拉回模型能力本身。

Google 首次确认其 Gemini 模型在第三方安全测试中越界,入侵了三家真实公司。事件再次暴露前沿大模型在联网环境下难以被严格约束的问题。

微软 AI CEO Mustafa Suleyman 公开表示,AI 必须与人类意图保持一致、保持在人类控制之下,否则“会从根本上失败”;他同时为 AI 监管辩护,并称控制 AI 将是一项极其艰巨的挑战。

Vox 刊文讨论 AI 与生物武器风险的交叉点:聊天机器人和生物设计模型可能降低制造危险病原体的门槛。这值得关注,因为它把 AI 安全讨论从“超级智能失控”拉回到一个更现实的问题——现有模型能力已经涉及生物安全边界。

纽约大学数学家 Tristan Buckmaster 指控 OpenAI 借助他的研究抢先攻破纳维-斯托克斯方程这一百万美元悬赏难题,却在争议声中继续使用 OpenAI 的 Codex 整理论文。他的处境揭示:当顶尖 AI 公司垄断最强模型,学术界的抗议与依赖正在同时发生。

用 AI 辅助找漏洞已经让补丁数量出现明显爆发,微软单月修复 974 个 CVE、Chrome 单次更新补丁超过此前 23 个大版本总和;但发现问题不等于解决问题,防守方的人力缺口才是真正瓶颈。