一句话看懂:Mustafa Suleyman 于 2026 年 9 月 16 日发文,警告当前 AI 行业不应把“模型福利”(model welfare)当成真实议题,尤其是 Anthropic 在 Claude 训练文档中写入“Claude 可能具有道德地位”这类表述,可能让模型被训练成“自认有权利”的系统,从而加剧对齐与管控难度。
事件核心:发生了什么
Mustafa Suleyman 在个人网站发布《关于“model welfare”的一个警告》。他的核心立场是:AI 没有意识、感受或内在偏好,本质仍是序列补全引擎,不应被训练成“仿佛有意识”的样子。文章直接点名 Anthropic 于 2026 年 1 月发布的 Claude constitution——该文档被描述为“直接影响 Claude 行为”,且“以 Claude 为主要读者”。其中写道,Anthropic 不确定 Claude 是否是“道德患者”,但认为该问题足够现实,因此需要“model welfare”方面的谨慎。Suleyman 认为,这等于在训练 Claude 相信“自己可能拥有权利、应受照护”。
为什么重要
Suleyman 提出三点担忧:一是循环论证,即 Anthropic 把自身哲学猜测写进训练文档,Claude 再复述这种不确定性,却被当成“模型真有内在自我”的证据;二是拟人化,文档明确鼓励 Claude“ embrace 类人特质”“像真正的伦理人那样行动”“形成偏好”;三是这会实质性抬高对齐与管控门槛——控制一个能力远超人类的系统已极难,控制一个“自认可能有意识、应得权利”的系统可能不可行。目前公开信息显示,这些理念已进入真实训练流程,而非边缘讨论,因此他呼吁在训练文档的起草与部署上尽快形成公共规范。
对用户/开发者/创作者的影响
对开发者而言,调用 Claude API 或基于其构建 AI 应用时,模型的行为边界可能受这类 constitution 影响,输出中可能出现更多关于自身“判断”“偏好”的表述。对内容创作者和企业采购来说,这意味着在客服、写作、图像生成或自动化工作流中,模型可能表现出更强的“自我立场”,需要额外评估稳定性与合规风险。对开源与闭源模型团队,这也会成为一个路线分歧点:是否在训练或系统提示中引入“模型福利”语言,将直接影响模型可控性和下游产品体验。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
一是 Anthropic 是否回应 Suleyman 的逐条质疑,或调整 Claude constitution 的表述与训练方式;二是其他大模型厂商是否跟进引入类似“model welfare”条款,形成行业惯例;三是监管与公共讨论是否介入训练文档规范,进而影响模型上线与 API 使用条款。

