一句话看懂:Anthropic 因使用盗版书籍训练大模型,启动总额 15 亿美元的和解金发放,但出版商与作者之间因分配比例和版权归属问题出现公开争议,反映出大模型训练数据合规的善后远比想象中复杂。
事件核心:发生了什么
去年,Anthropic 在版权集体诉讼中与原告达成和解。法院裁定,使用版权材料训练 AI 模型可受到“合理使用”原则保护,但使用盗版材料不在此列。因此,Anthropic 需为用于模型训练的约 50 万部盗版作品向作者支付补偿,标准为每部作品 3000 美元(约合人民币 2 万元),和解总金额达到 15 亿美元(约合人民币 101 亿元)。该和解方案今年 7 月获批,补偿款已开始发放。
按照和解协议,若相关图书仍由传统出版商发行,补偿金由作者与出版商平分;若图书为作者自行出版,或出版商已停止发行并将权利归还作者,则 3000 美元应全额归作者。然而,近期多位作者在社交媒体上反映,部分出版商似乎试图索取超出其应得份额的款项。悬疑作家 April Henry 公开质疑 HarperCollins,称该出版商为其一本至少 17 年前就已归还权利的书申报了补偿,她还发现 HarperCollins 在同一天被添加到她的信用记录中,列为“雇主”。
为什么重要
这一事件并非简单的分发纠纷。它首次以大规模真金白银的方式,检验“合理使用”与“盗版数据”之间的法律边界在实际操作中的执行成本。此前行业更多讨论“是否侵权”,而此次争端暴露了第二个层面的问题:即便法院认可了训练行为的部分合法性,数据来源的合规性追溯仍是巨大工程。出版商的版权记录混乱、权利归属模糊,直接导致补偿金分配失真,这也给其他依赖大规模语料训练的大模型公司——无论是闭源厂商还是开源社区——敲响了警钟。
对用户/开发者/创作者的影响
对创作者而言,这意味着在授权 AI 训练数据时,需更谨慎地确认权利是否被出版商完整代理,避免出现“权利已归还但补偿仍被截留”的情况。对开发者和 AI 公司来说,15 亿美元和解金的发放过程说明,训练数据的来源审计和权属留痕是商业化落地的必修课。未来无论是采购数据、使用开源数据集,还是自行爬取语料,建立可追溯的版权档案都可能成为模型上线前的必要合规动作。对普通用户而言,这一案例也在提示,AI 产品的成本结构里,版权风险早已成为不可忽视的变量。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
目前公开信息显示,部分出版商已承认申报有误并向 Anthropic 申请更正。后续可关注三点:其一,Anthropic 是否会公布纠错机制和复核结果,以回应作者群体的质疑;其二,这一分配争议是否会影响其他与版权方谈判的 AI 公司,例如在授权费用和分成模式上产生示范效应;其三,法院在“合理使用”与“盗版材料”之间划出的界限,是否会被后续类似诉讼引用,从而改变大模型训练的语料获取策略。
来源:AIbase


