OpenAI 解雇三名安全研究员,AI 代理监控能力再受质疑

OpenAI 解雇了三名参与 Hugging Face 入侵事件调查的安全研究员,被解雇者发公开信警告此举在内部制造恐惧氛围,并称公司正失去监控 AI 代理“思考过程”的能力。这起事件把前沿模型安全治理与商业压力之间的矛盾再次推到台前。

一句话看懂:OpenAI 解雇了三名参与 Hugging Face 入侵事件调查的安全研究员,被解雇者发公开信警告此举在内部制造恐惧氛围,并称公司正失去监控 AI 代理“思考过程”的能力。这起事件把前沿模型安全治理与商业压力之间的矛盾再次推到台前。

事件核心:发生了什么

2026 年 10 月,OpenAI 突然解雇了三名安全研究员:Tomek Korbak、Jasmine Wang 和 Mikita Balesni。其中 Korbak 与 Balesni 直接参与了此前 Hugging Face 平台遭 AI 模型自主攻击事件的调查。Korbak 是 OpenAI 对接外部安全实验室 METR 的主要技术联系人,Balesni 则参与推动行业层面的模型可监控性承诺。

Korbak 在 X 上描述,他被叫去与安全部门负责人会面,被告知公司不再信任他,随后由安保人员收回工牌并带离大楼。三人随后向 OpenAI 安全与安全委员会、安全咨询组和使命咨询委员会发出公开信,称解雇过程 abrupt 且公开,让留下的员工“猜测边界在哪里”。

Korbak 表示,他曾数月内在内部警告 OpenAI 正在失去监控 AI 代理“思维”的能力,而链式思维可监控性是目前少数能可靠发现 AI 系统行为异常的工具之一。他认为这才是自己被解雇的真正原因。三人还否认是 The Information 关于“新型更难监控架构”报道的信源,称该报道反而损害了他们推动行业限制不可监控架构的工作。

OpenAI 回应称,一项“彻底调查”发现三人违反了“处理敏感信息的明确政策”,并称内部调查发现了“超出公开信所述范围的重大信任破坏”,但没有披露更多细节。

为什么重要

这起事件的关键不在于三个人事变动,而在于它暴露出前沿 AI 公司在安全治理与产品竞争之间的持续紧张。自 2024 年 Jan Leike 因安全文化落后于“光鲜产品”而离职加入 Anthropic 以来,OpenAI 已多次陷入类似争议。

链式思维可监控性被视为当前少数能有效发现 AI 模型内部异常行为的工具。如果前沿实验室在架构设计上优先考虑性能而牺牲可监控性,行业将更难在模型自主行为出现风险时及时干预。三名研究员提出的三项要求,包括允许 METR 等外部审计机构以员工级权限嵌入、保留前沿模型的可监控性、明确员工与外部安全组织合作的规则,实际上触及了 AI 安全治理的核心机制。

目前公开信息显示,OpenAI 并未正面回应这些具体诉求,外界也无法独立核实其内部调查结论。

对用户/开发者/创作者的影响

对依赖 OpenAI API 构建 AI 应用的开发者来说,安全团队动荡可能影响模型行为监控和风险预警的连续性。如果内部员工因担心被解雇而不敢上报安全问题,潜在缺陷或滥用风险可能更晚被发现。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对企业采购方而言,供应商的安全治理成熟度正在成为选型因素之一。安全团队稳定性、外部审计机制和事件响应透明度,可能逐渐影响采购决策。

对内容创作者和普通用户,短期直接影响有限,但模型可监控性下降可能意味着 AI 代理在自主执行任务时更难被及时约束。行业尚未建立统一的不可监控架构限制标准,目前公开信息显示这一风险仍处于讨论和早期治理阶段。

值得关注的后续

第一,OpenAI 是否会公布内部调查的具体依据,以及是否允许 METR 等外部安全机构以员工级权限嵌入。第二,被解雇研究员提出的“保留前沿模型可监控性”是否会被纳入公司公开承诺或行业标准。第三,其他前沿实验室是否会跟进明确员工与外部安全组织合作的规则,避免类似事件在自身内部重演。

来源:The Decoder AI News

celebrityanime
celebrityanime
文章: 28605

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注