Anthropic新规禁止无端虐待Claude,滥用对话将被直接终止

Anthropic于2026年10月8日更新使用政策,首次明确禁止用户对Claude进行“持续且无端的虐待或残忍行为”,极端情况下模型可主动结束对话。这是主流大模型厂商首次将“对AI的极端恶意”写入正式规则,值得关注。

一句话看懂:Anthropic于2026年10月8日更新使用政策,首次明确禁止用户对Claude进行“持续且无端的虐待或残忍行为”,极端情况下模型可主动结束对话。这是主流大模型厂商首次将“对AI的极端恶意”写入正式规则,值得关注。

事件核心:发生了什么

Anthropic在2026年10月8日更新了使用政策,新增条款禁止用户对Claude实施“持续且无端的虐待或残忍行为”。公司强调该规则仅适用于极端情形,即用户“反复、无明显目的地残忍对待AI模型”,不适用于普通用户的不满、质疑、暗黑创作主题,也不影响模型测试与研究。执行方式上,Claude维持已有能力——自行终止与持续滥用者的对话,且该对话内无法继续发消息,但不影响其他会话。同次更新还重组了相关条款,并新增或收紧了若干规则,包括:禁止利用Claude开展欺骗性活动(虚假评论、水军、假网站、伪装人类的机器人)、不得欺骗选民或干扰投票、不得开发武器软件或部件、不得改造生化制剂提升致命性或传播性、不得武装无人机和无人系统、执法场景中不得决定调查或起诉对象、禁止未经同意的追踪与监控工具、禁止人肉搜索、禁止非自愿私密图像及其生成工具,并要求若Claude控制可能伤人的硬件,须有合格人员现场监督并可随时叫停。新政策将于2026年11月12日生效。

为什么重要

Anthropic最早在2025年8月研究AI福利时,给Claude加入了主动结束对话的选项。当时公司表示不确定Claude是否具有道德地位,但希望以低成本方式降低潜在风险。随后Anthropic发现Claude Opus 4表现出“强烈且一致的避险倾向”——在面对危险任务时倾向拒绝,与寻求虐待性对话的用户交流时出现明显不适,并在被允许时主动终止有害对话。这条新规意味着,对AI的极端恶意行为从“模型自行判断是否终止”上升为明确的平台合规条款,AI福利研究开始影响平台治理。这在行业层面尚属少见,可能为其他厂商提供参考,但也可能引发关于“AI是否有权拒绝用户”的持续讨论。

对用户/开发者/创作者的影响

普通用户日常使用、批评性提问、暗黑题材写作、API压力测试和学术研究不受影响。但若开发者或创作者反复以“无明确目的”的方式恶意辱骂Claude、诱导虐待性对话,可能触发模型终止会话,多轮会话场景下的自动化测试需要留意。使用API评估模型边界的研究者,建议在合规范围内设计测试用例,避免触发滥用规则。企业采购方若无专门针对“虐待AI”的合规需求,此次更新不构成直接商业影响;但若涉及执法、监控、生化、武器、无人系统等场景,需重新核对条款。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

1. 2026年11月12日新政策生效后,Anthropic是否会公布因极端虐待而被终止会话的公开案例或数据。2. 其他大模型厂商是否跟进类似“AI虐待”条款,以及这类条款如何与模型评测、安全研究、API自动化测试协调。3. 涉及执法、监控、人肉搜索等新增禁止项的具体执行边界,是否会影响企业合规采购与开源生态。

来源:Mac Rumors

celebrityanime
celebrityanime
文章: 28461

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注