用受版权保护的书籍训练AI模型合法吗?情况很复杂

用受版权保护的书籍训练大模型是否合法,目前法律界定仍然模糊。去年 Anthropic 虽被判支付 15 亿美元和解金,但法院核心裁定是“训练行为合法”,处罚针对的是盗版获取书籍的行为,而非训练本身。

一句话看懂:用受版权保护的书籍训练大模型是否合法,目前法律界定仍然模糊。去年 Anthropic 虽被判支付 15 亿美元和解金,但法院核心裁定是“训练行为合法”,处罚针对的是盗版获取书籍的行为,而非训练本身。

事件核心:发生了什么

美国地区法官 William Alsup 在 Anthropic 版权案中作出关键区分:大模型用文字作品训练,类似“阅读”而非“复制”,因此不构成侵权;但 Anthropic 从非法影子图书馆获取书籍的行为属于盗版,需向作家支付 15 亿美元赔偿。该案并非首例针对 AI 训练的法律裁决,但首次明确了“训练方式合法、数据来源非法”的边界。

与此同时,Thomson Reuters 诉 Ross Intelligence 案给出了另一维度:若用他人内容训练模型并直接构建竞争性法律平台,则不被视为“转换性使用”,不适用合理使用原则。两案结论相反,凸显当前司法对 AI 训练版权问题的判断并不统一——现行美国版权法自 1976 年以来未做实质更新,法官只能基于半个世纪前的框架解释新技术。

为什么重要

这两个判例共同勾勒出 AI 训练合规的核心分界线:训练行为本身在司法实践中更可能被类比为人类阅读学习,获得一定保护;但数据获取途径是否合法、训练产物是否直接竞争原作品市场,才是决定胜负的关键变量。对 AI 公司而言,自建合规数据集、购买授权或使用公开领域数据的商业价值正在上升,而依赖盗版数据集不仅面临赔偿风险,更可能让整个训练成果在法律上处于不稳定状态。

“合理使用”的判定标准目前高度依赖个案事实——使用目的、使用比例、市场替代效应都要逐一审查。这意味着 AI 行业短期内很难获得统一的安全港,训练数据合规成本将成为大模型竞争的重要隐性门槛。

对用户/开发者/创作者的影响

对开发者:如果使用开源模型或 API,上游训练数据的法律风险大概率不会传导至应用层,但若自己微调模型时使用爬取的书籍或文章,则需重新评估数据来源合法性。建议优先选用有明确授权的数据集,并保留数据来源记录以备合规审查。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对创作者:目前美国法院尚未支持“AI 生成内容直接替代作者市场”的主张,但 Thomson Reuters 案表明,若 AI 产品与原作品构成直接竞争关系,作者胜诉概率显著提升。创作者在维权时,应重点举证 AI 产品的市场替代效应,而非泛泛指控“用了我的书训练”。

对普通用户:短期内 ChatGPT、Claude 等产品的可用性不会因版权诉讼而中断。15 亿美元罚款对 Anthropic 这类预计 2028 年营收达 2000 亿美元的公司而言,属于可吸收的成本,不太可能直接影响产品定价或功能迭代。

值得关注的后续

一是 Anthropic 案是否会上诉至更高层级法院,以及后续判决是否维持“训练等同阅读”的类比——这将为行业提供更稳定的先例。二是美国版权局或国会是否会启动法律修订程序,明确 AI 训练数据的合理使用边界,而非继续依赖法官个案裁量。三是 Thomson Reuters 案确立的“直接竞争”标准是否会被其他法院引用,尤其是当 AI 写作工具越来越接近原创作者风格时,市场替代效应的举证门槛是否会降低。

来源:TechCrunch AI

celebrityanime
celebrityanime
文章: 19845

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注