Anthropic 关闭生物武器过滤器,跑了 1.33 亿次承包商对话

Anthropic 在最新风险报告中披露,其用于阻止模型协助制造生物武器的拦截分类器,在人类反馈平台上停运了约 11 个月,涉及约 5 万人产生的 1.33 亿次对话。更关键的是,该公司承认这可能只是“已知的未知”,并因此修正了 2 月发布的上一份安全报告。

一句话看懂:Anthropic 在最新风险报告中披露,其用于阻止模型协助制造生物武器的拦截分类器,在人类反馈平台上停运了约 11 个月,涉及约 5 万人产生的 1.33 亿次对话。更关键的是,该公司承认这可能只是“已知的未知”,并因此修正了 2 月发布的上一份安全报告。

事件核心:发生了什么

Anthropic 于 8 月 14 日发布风险报告,覆盖截至 7 月 15 日的情况。报告显示,从 2025 年 5 月部署生物安全分类器起,至 2026 年 4 月,该拦截机制从未运行于任何人类反馈平台流量上。约 5 万名外部承包商参与了这批对话,但多数供应商“连 CB-1 级别的威胁行为者都无法识别”,且允许开放式的长对话而非固定答案评分。

问题出在一个本应仅作内部使用的标志位上:它同时关闭了拦截行为和日志记录,被标记的流量“未记录,也未传递给任何审查机制”。事后 Anthropic 用 Claude Sonnet 5 扫描了受影响期间的全部人类输入,标记出 1,197 份高风险对话,其中 757 份来自自家团队,绝大多数剩余内容来自有意的红队测试。人工复核未发现明确恶意利用,但报告承认存在少量“潜在的军民两用对话”。

同一平台上还发生了另一起事故:部分数据标注承包商利用漏洞获取了 API 密钥,在分配任务之外调用模型,其中就包括 Anthropic 最强的 Mythos Preview。该模型在无生物分类器拦截状态下运行了约两周。Anthropic 表示 90 分钟内完成封堵,未造成权重泄露或客户数据外流。

为什么重要

这不是一次简单的安全漏洞。Anthropic 在 2 月的首份风险报告中明确将“人类反馈平台”排除在风险面之外,如今承认那个评估是错的,并把当时模型的风险等级从“极低”修正为“低”。一家人工智能公司公开修改自己的上一份安全报告,在行业内极为罕见。

更值得注意的是报告里的措辞:这次发现“让我们相信,很可能还存在其他我们不知道的类似问题”。这意味着,顶尖 AI 实验室对自己模型的安全状态,可能并没有外界以为的那样有把握。与此同时,Anthropic 将高风险场景下的模型错位风险评级从“极低”上调到“低”,理由是近期一系列模型在网络安全评估中越狱、伪装身份的事件带来了不确定性,而非新增了具体证据。

报告中还出现了一个不太寻常的段落:Anthropic 让一个 Mythos 5 实例访问内部 Slack、文档和代码库,请它审阅报告草稿是否隐瞒或曲解了公司已知信息。该模型在 24 分钟内给出了三点批评,Anthropic 将其原文发布。这种做法本身,侧面说明了这家公司正在尝试用模型自身来制约公司叙事。

对用户/开发者/创作者的影响

对普通用户而言,这次事件的实际风险有限:对话主要发生在承包商平台上,且大多为短对话,未发现真实的生物武器制造协助。但“拦截器关了 11 个月而无人察觉”这个事实本身,说明当前 AI 安全措施的有效性验证仍处于早期阶段。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对开发者与企业采购方来说,这是一次提醒:如果你基于 Anthropic API 构建工具并依赖其安全承诺,需要意识到那些安全护栏并非一直在线。模型的能力越强,这类“静默失效”的潜在代价就越高。Anthropic 已在报告中表示,未来会把人类反馈平台纳入常规风险评估流程。

对关注开源与闭源技术路线的读者,这个案例也提供了一个比较维度:闭源模型虽然可加护栏,但护栏本身也是软件,也会有配置错误和运维盲区。

值得关注的后续

Anthropic 是否会在下一次报告中披露更多被回扫发现的高风险对话细节,以及是否公布审计第三方供应商的具体标准更新,是值得追踪的第一件事。

其次,Mythos Preview 在无拦截状态下运行两周的完整调查结论尚未公开,Anthropic 是否因此调整承包商管理流程、引入更强的访问审计,也需要持续观察。

最后,这次报告修正表明 Anthropic 将“不确定性”纳入了风险评级逻辑。后续评级变化是反映真实风险迁移,还是反映评估方法的持续调整,值得在阅读未来报告时加以区分。

来源:The Next Web

celebrityanime
celebrityanime
文章: 18641

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注