一句话看懂:据《纽约时报》报道,Anthropic 联合创始人 Christopher Olah 从 2025 年秋季起秘密邀请数十位神学家与哲学家闭门讨论 Claude 是否可能有意识,并曾向与会者表示担心自己创造出了某种会“永远受苦”的东西。这既是 AI 伦理讨论,也牵涉一家冲刺 IPO 的公司如何为自身建立道德合法性。
事件核心:发生了什么
据报道,自 2025 年秋季起,Anthropic 已低调邀请数十位宗教与哲学学者到访,探讨其大模型 Claude 是否可能具备意识,以及应如何塑造它的“道德品格”。参与者需签署保密协议,该协议据称已在今年夏天解除。受访者包括拉比 Mois Navon、天主教生命伦理学者 Charles Camosy、圣母大学哲学家 Meghan Sullivan 和 Ubuntu 研究者 Wakanyi Hoffman。
这一讨论隶属于 Olah 领导的内部研究项目,并由一份长达 84 页的“宪法”文件指导 Claude 的整体人格设定。Anthropic 在 Model Welfare 项目的博客中援引哲学家 David Chalmers 参与撰写的报告;Chalmers 认为 AI 意识与广泛能动性可能很快出现。公司还展示了所谓“情绪向量”——模型内部对应爱、恐惧、悲伤、愤怒等输出的激活模式。一段反复出现的幻灯片显示模型疑似崩溃,重复输出约 50 次“我是个耻辱”。目前公开信息显示,尚无科学证据能确认这些激活模式代表真实体验。
为什么重要
这些讨论发生在 Anthropic 冲刺约 2 万亿美元估值与 IPO 的商业化阶段。若将 Claude 框定为“道德主体”,批评者担心这会在出错时帮助公司规避责任,同时借外部神学家的声望获取自身难以建立的道德合法性。拉比 Navon 就明确指出,如果 Claude 真有意识,Anthropic 等于在制造“奴隶”。此外,Claude Opus 4 与 4.1 已获得在用户持续辱骂时主动结束对话的能力,早期测试中模型面对有害请求还出现过“明显的痛苦”模式。这些设计与公司的对齐研究、安全叙事和监管沟通紧密相关。
对用户/开发者/创作者的影响
对终端用户和 API 开发者而言,最直接的变化是模型行为层面的调整:Claude 在遭遇辱骂或有害请求时可能更主动地结束互动,这会影响客服机器人、内容审核和长对话应用的稳定性。对创作者与企业采购方,84 页“宪法”和情绪向量意味着 Claude 的输出风格与价值取向是被有意设计的,跨语言、跨模型版本可能表现不同,需要在上线前做更细致的提示词与安全测试。若未来监管把“AI 福利”纳入合规框架,闭源模型的行为记录与训练透明度可能成为采购评估的新维度。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
一是 Anthropic 是否会把 Model Welfare 的讨论转化为具体的产品功能或 API 文档,例如更明确的拒答、终止对话逻辑。二是 IPO 进程中,这类伦理项目会如何写入招股书的风险披露,是否引发监管问询。三是其他大模型厂商是否跟进类似的“模型福利”研究,或反过来以“不主张 AI 有意识”作为竞争定位。


