嵌入式评估员”到底是什么?在前沿实验室负责人看来,这是AI领域最重要的工作之一。

Anthropic CEO Dario Amodei 提议前沿 AI 实验室应设立“嵌入式评估员”——拥有员工级权限、可独立审查模型安全实践并公开结论的外部人员。OpenAI 的 Sam Altman 和 xAI 的 Elon Musk 都公开表示支持,这类岗位可能成为 AI 安全治理的新标配。

一句话看懂:Anthropic CEO Dario Amodei 提议前沿 AI 实验室应设立“嵌入式评估员”——拥有员工级权限、可独立审查模型安全实践并公开结论的外部人员。OpenAI 的 Sam Altman 和 xAI 的 Elon Musk 都公开表示支持,这类岗位可能成为 AI 安全治理的新标配。

事件核心:发生了什么

2026 年 9 月,Anthropic CEO Dario Amodei 在一篇博客文章中提出,前沿 AI 实验室应当把独立安全评估员“嵌入”到组织内部。这些评估员的职责是核查公司是否真正落实了其所宣称的训练、部署、运营和安全防护流程,而不是只看公开声明。

按照 Amodei 的设想,嵌入式评估员将获得类似员工的权限:在 Anthropic 办公室有工位、门禁卡和公司笔记本电脑,可以查看内部信息、核实安全实践并上报事件。他们还有权公开发布任何调查发现,Anthropic 仅在涉及安全敏感、法律特权、商业机密或第三方保密信息的狭窄范围内进行删减,不能因为结论不利就屏蔽。

这一提议迅速获得同行响应。OpenAI CEO Sam Altman 转发并表示“我们将采取同样的做法”,Elon Musk 也表态“Dario 说得对”。前 a16z 合伙人、前特朗普 AI 顾问 Sriram Krishnan 则强调需要分布式评估网络,并建议资助多个此类项目。

为什么重要

当前大模型能力快速提升,外界对训练过程、推理行为和闭源模型内部安全措施的可见度极低。如果评估员完全由被审查公司挑选和支付,独立性就难以保证。嵌入式评估员的核心价值在于:把“自查”变成“可被外部验证的承诺”,让安全声明不再是公关话术。

人才流向已经出现信号。非营利 AI 监督机构 Metr(2022 年由前 OpenAI 员工 Beth Barnes 创立)正在吸引顶尖实验室成员:前 Anthropic 安全与监督团队成员 Joe Benton、前 Google DeepMind AGI 安全团队成员 Josh Engels 近期均宣布加入。斯坦福 HAI 高级研究员 Christopher Manning 也提出,大学在部分评估工作中可能比任何机构都更合适。这表明“评估”正在从边缘岗位变成 AI 产业链的一环。

对用户/开发者/创作者的影响

对普通用户和开发者来说,嵌入式评估员不会直接改变模型能力或 API 价格,但会影响模型上线节奏和合规披露。如果评估员发现训练数据、安全防护或部署流程存在问题,部分模型或功能可能延迟发布,企业在采购大模型 API 时也可能要求供应商提供更明确的安全评估记录。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对开发者和创业者而言,评估环节的独立化意味着围绕模型审计、安全测试、合规报告的工具链可能形成新需求。如果评估结论可以公开发布,闭源模型和开源模型在安全透明度上的差异也会被更直接地比较。

值得关注的后续

第一,OpenAI 是否会真正落地 Altman 承诺的同类机制,还是停留在表态阶段。第二,评估员的选任和薪酬由谁承担——AI 验证与评估研究机构执行总监 Miles Brundage 指出,评估员不应由被审查公司挑选和支付,行业还需要“有约束力的要求”,目前公开信息显示这些制度细节尚未明确。第三,Anthropic 之外的前沿实验室是否跟进,以及评估结论能否在模型发布前而非事后公开。

来源:Business Insider

celebrityanime
celebrityanime
文章: 23408

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注