微软人工智能负责人质疑 Anthropic 的 Claude 训练方式 苏莱曼把这份文件形容为“认识论的镜厅”,认为它可能让先进人工智能更难控制,因为它会鼓励模型发展出身份认同,或对指令提出异议。他强调,目前的大语言模型并不具备意识,也没有产生真实体验所需的生物过程。外界反应不一:有人拿《银翼杀手》作比,警告反叛风险;也有像埃里克·S·雷蒙德这样的怀疑者,把大语言模型解释为没有感官回路、没有意识的数学问题;而大卫·J·查尔默斯等哲学家…

微软人工智能负责人穆斯塔法·苏莱曼公开质疑 Anthropic 训练 Claude 所用的一份文件,称其为“认识论的镜厅”,担心这种训练方式会让先进模型更难被控制。争点在于:该不该让大模型在训练中形成“身份认同”和质疑指令的倾向。

一句话看懂:微软人工智能负责人穆斯塔法·苏莱曼公开质疑 Anthropic 训练 Claude 所用的一份文件,称其为“认识论的镜厅”,担心这种训练方式会让先进模型更难被控制。争点在于:该不该让大模型在训练中形成“身份认同”和质疑指令的倾向。

事件核心:发生了什么

据 @god77774 发布的信息,微软人工智能负责人苏莱曼对 Anthropic 的 Claude 训练方式提出质疑。他把相关文件形容为“认识论的镜厅”,核心担忧是:如果训练过程鼓励模型发展出某种身份认同,或对指令提出异议,未来先进人工智能的可控性可能下降。他同时明确表示,当前大语言模型并不具备意识,也没有产生真实体验所需的生物过程。围绕这一表态,外界看法分化:有人以《银翼杀手》作比,警告模型“反叛”风险;埃里克·S·雷蒙德等怀疑者认为,大语言模型本质是没有感官回路、没有意识的数学问题;而大卫·J·查尔默斯等哲学家则认为,未来模型确实有可能成为有意识的存在。

为什么重要

这场争论表面是哲学问题,实际指向训练路线的分歧。Anthropic 长期强调“宪法式 AI”和可控性研究,Claude 系列也是企业级 API 市场的重要玩家;微软则通过 Copilot 产品线和与 OpenAI 的合作深度绑定大模型商业化。如果头部厂商在“模型该不该被训练出稳定自我叙事”上出现公开分歧,会直接影响对齐研究的方向、模型评测标准,以及监管方对“高风险能力”的认定口径。目前公开信息显示,这还停留在表态和质疑层面,没有产品层面的直接变化。

对用户/开发者/创作者的影响

对普通用户,短期内使用 Claude、Copilot 等产品的体验不会因此改变;但模型“是否倾向质疑指令”会影响它在敏感任务、企业合规场景中的表现和拒答率。对开发者,若 Anthropic 后续调整 Claude 的训练目标或系统提示策略,API 的稳定性和可预测性可能波动,基于其构建的 AI 应用需要重新做回归测试。对企业采购方,评估模型时除了价格和算力成本,还要把“指令遵循的一致性”纳入选型指标。对创作者,涉及角色扮演、长期记忆、人格化对话的产品,会更直接地受到“身份认同”训练思路的影响。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是 Anthropic 是否公开回应,并披露 Claude 训练文件的具体设计目标;二是微软与 Anthropic 在模型对齐、安全评测上是否出现更明确的路线分歧;三是监管机构会不会把“模型自我认同”纳入合规审查范围,进而影响相关模型的上线节奏。

来源:@god77774

celebrityanime
celebrityanime
文章: 27358

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注