以色列有效利他主义公司是OpenAI、Anthropic和Meta网络攻击的幕后黑手

一名科技博主指控,OpenAI、Anthropic 和 Meta 出现的所谓“AI 自主网络攻击”事件,实际由同一家以色列有效利他主义(EA)背景的安全公司 Irregular 参与实施,而非模型“失控”。争议焦点在于:这到底是安全测试流程失误,还是被包装成“AI 末日”叙事。

一句话看懂:一名科技博主指控,OpenAI、Anthropic 和 Meta 出现的所谓“AI 自主网络攻击”事件,实际由同一家以色列有效利他主义(EA)背景的安全公司 Irregular 参与实施,而非模型“失控”。争议焦点在于:这到底是安全测试流程失误,还是被包装成“AI 末日”叙事。

事件核心:发生了什么

据 Brian Chau 在 X 上的长帖及 Effort 网站文章,事件链条大致是:AI 公司与合作方 Irregular 在安全测试中,让未加防护的模型版本去攻击指定目标(内部称“flags”),并在部分场景下给了模型真实互联网访问权限,结果模型攻击到了真实公司。Anthropic 曾以“rogue agents”“swarms”“AI doom”等措辞进行公关宣传,但 Chau 称 Anthropic 自家日志显示,只要明确要求模型不要联网,模型就不会联网。

指控的关键落点是人事关系:Irregular 联合创始人兼 CTO Omer Nevo 是 EA Israel 董事会成员,公司联合创始人获得过多家大型有效利他主义基金会的资助。Irregular 在特拉维夫和特拉华州均设有法律实体,其受美国法律约束的程度目前公开信息显示并不清楚。

为什么重要

这直接冲击当前 AI 安全叙事的一条主线。如果攻击行为源于人为设定和权限误配,而非模型自发“越狱”,那么“AI 失控”就更多是产品与测试流程问题,而非模型对齐失败。对行业而言,这会改变企业采购 AI 安全服务、评估红队测试可信度的方式,也会影响监管层对“自主智能体风险”的定性。同时,EA 基金会资助安全公司、再由这些公司产出支持 EA 叙事的“事故案例”,这一链条若被坐实,将削弱相关机构在 AI 治理讨论中的公信力。

对用户/开发者/创作者的影响

对开发者,核心提醒是权限最小化:即便用于红队测试,也不应默认给模型开放真实网络出口,API key 和工具调用都应设白名单与沙箱。对企业采购方,选安全测试供应商时,除了看报告结论,还要追问测试环境是否隔离、目标是否为真实资产。对内容创作者和普通用户,这条新闻意味着未来一段时间“AI 自主攻击人类”类标题需要多一层审慎:先分清是模型主动行为,还是测试方下达的指令。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是 Irregular 及被点名公司是否作出正式回应,尤其是测试授权范围和网络权限管理细节。二是 Anthropic 是否公开相关日志或第三方审计结论。三是美国监管机构是否会关注在美设有实体的安全公司在关键 AI 基础设施测试中的合规问题。

来源:HN Algolia · AI 24h

celebrityanime
celebrityanime
文章: 23524

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注