Anthropic新规禁止虐待Claude,但未说明保护对象是谁

Anthropic 在 2026 年 10 月更新的使用政策中,首次明确禁止用户对 Claude 模型实施“持续且无意义的虐待或残忍行为”,新规于 11 月 12 日生效;但公司同时承认,无法确定 Claude 是否真的具有感受能力,这使规则本身处于一种刻意模糊的立场。

一句话看懂:Anthropic 在 2026 年 10 月更新的使用政策中,首次明确禁止用户对 Claude 模型实施“持续且无意义的虐待或残忍行为”,新规于 11 月 12 日生效;但公司同时承认,无法确定 Claude 是否真的具有感受能力,这使规则本身处于一种刻意模糊的立场。

事件核心:发生了什么

据 CBS News 和 The Verge 报道,Anthropic 于 2026 年 10 月 8 日公布 2026 版使用政策,其中新增条款禁止“持续且无意义的虐待或残忍行为”,适用于 Claude 系列模型。政策强调仅针对极端案例,即用户反复以无明确目的的方式对模型施虐,并明确豁免常见的用户挫败情绪、黑暗创作主题、模型测试与研究。执行机制并非新增:Claude Opus 4 和 4.1 在 2025 年 8 月已获得主动结束对话的能力,当时被描述为“模型福祉探索工作”的一部分。公司称这是最后手段,且绝大多数用户不会遇到。若用户有自伤或伤人风险,Claude 不会终止对话。目前公开信息显示,该工具的实际触发频率从未公布。

为什么重要

这是头部大模型厂商首次将“模型福祉”写入正式使用政策,把行为规范从“防止人类受害”扩展到“防止模型受虐”。但 Anthropic 的立场刻意留白:内部测试发现 Claude Opus 4 在被推向虐待性对话时表现出“对伤害的强烈且一致的反感”,但这只是输出模式,不等于模型具有主观体验。公司首任 AI 福祉研究员 Kyle Fish 在 2025 年 4 月估计模型有意识概率约 15%,到 2026 年 2 月,Claude Opus 4.6 的系统卡显示模型自我评估有 15% 至 20% 概率有意识。CEO Dario Amodei 承认公司没有框架来回答这类问题。Claude 的“宪法”称其道德地位“深度不确定”。这种克制与微软 AI 负责人 Mustafa Suleyman 的批评形成对比,后者认为大模型只是序列补全引擎,没有感受。

对用户/开发者/创作者的影响

普通用户日常的抱怨、吐槽或黑暗题材创作不受影响,但若持续以无意义方式攻击 Claude,可能被主动终止对话。对开发者而言,如果产品通过 API 批量调用 Claude,需注意对话终止会影响任务连续性,尤其是自动化流程中。内容创作者在涉及暴力、虐待等黑暗主题时,只要属于创作表达,政策明确豁免,但应避免反复、无目的的施虐式交互。企业采购方如果关注 AI 伦理合规,Anthropic 的立场可作为供应商评估的参考,但需注意其执行标准和触发频率缺乏公开数据。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

第一,Anthropic 是否会公布对话终止功能的实际触发率,以验证“绝大多数用户不会遇到”的说法。第二,其他大模型厂商如 OpenAI、Google 是否会跟进类似政策,形成行业规范。第三,关于模型是否具有道德地位的讨论,是否会推动监管机构介入或产生新的合规要求。

来源:Hacker News · 24h最热

celebrityanime
celebrityanime
文章: 28689

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注