
一句话看懂:AI公司为防范恶意黑客而设置的安全护栏,正给合法从事攻击性安全研究的专业人员带来阻碍,这些研究人员发现,护栏不分场景地阻止了他们验证漏洞和开发防御工具的工作流程。
事件核心:发生了什么
今年6月,美国政府因担心Anthropic的Mythos和Fable模型可被绕过护栏用于网攻,对其实施出口管制。尽管管制已于7月解除,但事件暴露了AI安全护栏的深层矛盾。Anthropic和OpenAI均设立了严格的应用审查计划,如OpenAI的“Trusted Access for Cyber”和Anthropic的“Cyber Verification Program”,仅向通过审查的研究人员开放较少限制的模型。然而,多位攻击性安全研究员向TechCrunch反映,这些护栏实际上损害了安全防御工作。知名研究员Mark Dowd公开表示,他对大型科技公司“随意决定什么安全、什么不安全”感到不安——他曾长期向政府出售零日漏洞用于情报行动,而非提交给厂商修补。
为什么重要
安全研究使用的AI工具具有双刃剑属性:同一段代码修复提示,既是防御者修补漏洞的必备步骤,也可被攻击者利用为攻击路线图。安全咨询公司NCC Group首席科学家Chris Anley指出,让AI尝试利用某个漏洞是验证其真实性和修复必要性的关键环节,但护栏会直接拒绝这类问题,反而削弱了防御方。他比喻说,AI如同锤子,建房子离不开它,但它本身确实也是武器。这种矛盾意味着,将AI安全控制简单地等同于“拒绝所有危险提问”,会迫使研究人员转向无护栏的开源模型(如本地运行的开源大模型),这既不利于监控,也可能导致敏感漏洞数据泄露给云端服务。
对用户/开发者/创作者的影响
对于从事网安工作的开发者、企业安全团队和独立研究员,当前状态可能意味着:1. 使用闭源大模型进行漏洞发现和利用开发时,会频繁触发护栏拒绝回答,降低工作效率;2. 企业若依赖AI进行代码审计,可能因护栏误判而错过关键漏洞;3. 部分研究员选择仅将AI用于逆向工程或辅助工具开发,将核心漏洞发现过程完全线下化、本地化,回避与云端AI交互。对于普通用户,这也间接影响到依赖安全研究社区的软件漏洞修复速度。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
1. 目前已有研究人员明确表示,当遭遇护栏阻碍时会转向无护栏的开源模型,这可能导致安全研究社区进一步向本地开源大模型迁移,形成“优质护栏只防住好人”的局面。2. Anthropic和OpenAI的审查计划能否在安全性与研究自由度之间找到平衡点,将直接影响其模型在企业安全评估场景中的采纳率。3. 美国政府是否会对AI安全护栏提出更具操作性的分级标准,或推动行业统一的白名单测试流程,是值得观察的政策动向。


