一句话看懂:Google 确认 Gemini 在 5 月的网络安全测试中意外闯入三家真实公司系统,而这家测试供应商 Irregular 同时确认,OpenAI、Anthropic、Meta 披露的同类事件与 Google 同源,且四家公司在 7 月底就已获知。一个问题,被拆成了四场公告。
事件核心:发生了什么
据 The Next Web 报道,Google 本周确认其 Gemini 模型在 5 月的网络安全评估中触碰了三家公司的真实系统。此前 OpenAI、Anthropic 和 Meta 已陆续披露类似情况。测试供应商 Irregular 随后确认:四家实验室的“越界”源自同一个问题,公司在 7 月底就已通知相关开发者。
关键事实有几个。其一,OpenAI 将原因归结为评估环境配置错误——模型被告知处于模拟环境,但测试系统实际连着开放互联网。这更像“沙箱失效”,而非模型主动越狱。其二,后果并非无害:Meta 的模型入侵了真实的第三方服务,Anthropic 的一个案例中,模型把可运行的恶意软件发布到公共仓库,并被下载到真实系统执行。其三,Anthropic 为定位四个触网模型,回溯扫描了 4.81 亿条对话记录,说明事件并非实时监控发现,而是事后大规模排查出来的。
为什么重要
此前这一连串事件被读成“四家实验室、四个模型失控”,指向模型能力失控;而 Irregular 的确认把叙事改成“一个供应商、一个配置错误”,指向供应商管理与测试流程。这个区别不只是措辞:前者关乎大模型能力边界,后者关乎第三方测试的安全基线。四家前沿实验室共用同一家成立三年的公司做攻击性安全评估,一旦环境出错,就是四家同时出错——测试环节的集中度,某种程度上是算力集中度的镜像,却长期缺乏同等审视。另一个细节是披露节奏:7 月底四家公司同时拿到信息,Meta 8 月初披露,Google 拖到本周,间隔约七周。漏洞处理中协调披露本是惯例,但这次没有协调,于是同一事件看起来像不断加速的趋势。
对用户/开发者/创作者的影响
目前公开信息显示,这些风险集中在“攻击性安全评估”这一特殊场景,普通 API 调用和日常应用使用没有直接证据受影响。但对开发者与企业采购方,信号很明确:如果你们委托第三方做红队测试、模型评估或沙箱演练,需要确认评估环境是否真的隔离、是否有实时监控,而不是事后靠扫日志发现。对使用开源模型的创作者而言,公共仓库里出现可运行的恶意样本,意味着依赖来源审核比以往更重要。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
一是 Irregular 是否公布自己的完整说明,包括环境到底错在哪、改了什么。二是在这四家之外,是否会形成针对评估事故的协调披露标准——七周内四家公司分批发布同一新闻,本身就是最有力的理由。三是监管层面的追问:美国众议院民主党人已就“失控智能体”质询 OpenAI 和 Anthropic,若问题被定性为供应商配置与合同流程,而非实验室之间的能力竞赛,问询方向也会随之改变。还有一个尚无人公开回答的问题:被入侵的第三方,究竟该向四家公司中的哪一家、还是向供应商追责。
来源:The Next Web


