Anthropic生物武器过滤器宕机近一年,1.33亿个请求未经过滤

Anthropic 的生物武器过滤器从 2025 年 5 月到 2026 年 4 月静默失效近一年,约 5 万名外包承包商人员的 1.33 亿次模型对话未经过滤。Anthropic 声称没有发现实际滥用证据,但这一安全治理漏洞对 AI 行业的信任和合规审查机制提出了警示。

一句话看懂:Anthropic 的生物武器过滤器从 2025 年 5 月到 2026 年 4 月静默失效近一年,约 5 万名外包承包商人员的 1.33 亿次模型对话未经过滤。Anthropic 声称没有发现实际滥用证据,但这一安全治理漏洞对 AI 行业的信任和合规审查机制提出了警示。

事件核心:发生了什么

据 The Decoder 报道,Anthropic 在近期发布的安全报告中披露,其用于阻断模型输出化学和生物武器相关知识的生物分类器,从 2025 年 5 月至 2026 年 4 月整整近一年时间处于停用状态。该过滤器本应用于拦截模型向用户提供危险知识。此期间,为 Anthropic 模型提供人类反馈(RLHF)的外部承包商有约 5 万人参与,合计产生约 1.33 亿次聊天请求,全部绕过过滤器。

Anthropic 表示,这些承包商仅由外部供应商进行审核,而这些供应商的筛选流程常存在不足。公司内部调查未发现实际滥用行为,但已收紧对承包商的要求。值得注意的是,Anthropic 近期还放宽了 Fable 5 模型上的分类器,原因是研究人员抱怨过滤过于激进,阻碍了合法研究。

为什么重要

这一事件的核心问题不只是一次配置失误,而是 AI 安全机制在长时间内静默失效而未被发现。Anthropic 的 CEO 曾多次公开强调,AI 辅助开发化学和生物武器的威胁大于网络攻击,此次事故与其对外宣称的安全立场形成明显反差。

从行业角度看,它暴露出 AI 安全治理中的供应链盲区:当模型训练依赖大量外部人力时,承包商的审核标准和权限控制会成为安全链条中最薄弱的环节。对于一家以安全为核心卖点的大模型公司而言,近一年内风险访问未过滤且未被察觉,意味着现有的安全监控体系缺乏对安全机制本身的“健康检查”。

对用户/开发者/创作者的影响

对于调用 Anthropic API 的开发者或企业客户,目前公开信息显示现有模型服务已恢复正常过滤,但此次事件提醒开发者不应完全依赖模型供应商的安全承诺。涉及高危知识领域的 AI 应用,建议在应用层自行增加输出检测与审计机制,并定期核验供应商的安全公告。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对于企业采购方,在选择大模型供应商时,除关注模型能力外,也应将安全治理透明度、供应链审核流程纳入评估维度。此次事件中 1.33 亿次未过滤请求虽未引发实证危害,但审计缺失本身就是重大安全隐患。

值得关注的后续

后续可以关注三个方向:一是 Anthropic 是否会公布更多关于过滤器失效根因和修复细节的技术报告;二是 Fable 5 放宽分类器后,模型在高危知识提取方面的实际表现与滥用风险是否回弹;三是其他头部大模型公司是否会跟进调整承包商审核标准,或者推动行业形成统一的安全筛选基准。

来源:The Decoder AI News

celebrityanime
celebrityanime
文章: 18739

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注