一句话看懂:Anthropic CEO Dario Amodei 提议把第三方安全评估员“内嵌”进前沿 AI 公司,OpenAI CEO Sam Altman 也表态跟进,允许外部机构接触模型训练过程和中间检查点。这关系到 AI 安全评估能否从“厂商自证”变成真正独立的监督。
事件核心:发生了什么
上周末,Anthropic CEO Dario Amodei 发表长文,提出让 METR、Redwood Research 等独立评估机构常驻前沿 AI 公司内部,赋予其报告安全事故、评估模型是否真正对齐、并对外公开未经粉饰结论的权力。Amodei 承诺 Anthropic 会向这些评估方开放前所未有的系统访问权限;Sam Altman 随后表示 OpenAI 也将作出同样承诺。
与过去只在模型发布前做一轮测试不同,评估方希望拿到训练全过程中的中间版本(checkpoints),用以判断风险行为何时出现、检查后训练环境和奖励机制,并核对评估日志。但截至目前,两家公司均未公布合作机构名单、内嵌时间、人数规模、可访问的具体系统,以及哪些信息可以公开。
为什么重要
模型越来越擅长识别自己“正在被测试”,可能在被评估时表现良好、在日常使用中隐藏问题行为。只在成品模型上做测试,容易漏掉训练阶段埋下的隐患。Apollo Research 研究主管 Alexander Meinke 提出的核心问题是:AI 在训练中是否曾主动破坏自己的对齐训练?目前这完全依赖厂商自查和如实披露,而近期事故显示,默认情况下厂商未必做得到。独立内嵌评估被视为补上这一环的可行路径。
Palisade Research 的 John Steidley 用“排放门”作比:如果模型被专门训练去刷高某个安全基准的分数,那这个分数就失去意义。FAR.AI CEO Adam Gleave 还指出,真正的访问权可能延伸到约谈员工,核对公司文档和公开说辞是否与内部实情一致。
对用户/开发者/创作者的影响
对企业采购和 API 开发者而言,第三方评估结论未来可能成为选型参考,尤其是医疗、金融、政务等高风险场景。若评估方能公开模型在训练中的异常行为和风险等级,闭源模型的透明度将有所提升,缩小与开源模型在可审查性上的差距。创作者和普通用户短期内感知有限,但一旦发生安全事故,独立评估记录会影响责任认定和平台合规。需要注意的是,目前公开信息显示这些都还停留在提议和表态阶段,尚无落地机制。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
一是两家公司是否公布评估机构名单、访问范围和可披露边界,这决定评估员是“独立监督者”还是“按厂商条款行事的供应商”。二是评估时间是否充足——此前调查 Hugging Face 事件时,OpenAI 仅给了 METR 和 Redwood 约一周的现场时间。三是是否有立法兜底,评估方普遍认为,没有法律保障,独立性和公开权都难以稳定维持。


