一句话看懂:美国作家群体向法院提交动议,指控 OpenAI 在未获授权的情况下,通过盗版网站 LibGen 获取书籍并用于训练 GPT 模型,且在论文中刻意掩盖数据来源。此案若获法院支持,将直接冲击“合理使用”作为大模型训练核心抗辩的法律基础。
事件核心:发生了什么
在纽约南区法院合并审理的针对 OpenAI 与微软的版权诉讼中,包括美国作家协会集体诉讼、非虚构作家群体诉讼以及 Tremblay 和 Silverman 案在内的原告方,于本周提交了部分简易判决动议。动议覆盖 194 部作品,要求法官 Sidney Stein 直接裁定 OpenAI 未经许可复制受版权保护书籍,且该行为不构成“合理使用”。
原告方提交的诉讼文件指称,OpenAI 并非通过合法渠道购买书籍,而是从已被美国贸易代表列入“恶名市场”名单的盗版图书馆 LibGen 下载资源,甚至使用了 torrent 方式。文件指出,OpenAI 在 GPT-3 论文中曾将数据集名称“LibGen1”和“LibGen2”修改为含义模糊的“Books1”和“Books2”,并在 2022 年夏季出于法律顾虑删除了相关 LibGen 文件——这也是 OpenAI 唯一删除过的两批训练语料。
此外,原告举证称,OpenAI 于 2022 年聘请的写作质量负责人 Tarun Gogineni 曾在 2025 年发布推文,称其“研究使命”是让 GPT 模型写完乔治·R·R·马丁《冰与火之歌》的最后两本书,并认为即使作者去世,AI 也能自动续写完成。原告认为,这表明 OpenAI 构建模型的目的之一就是替代其复制内容的创作者。
为什么重要
该动议将 AI 版权争议从“生成内容是否侵权”推进到了“训练数据获取方式是否合法”的层面。此前 Anthropic 相关案件(Bartz v. Anthropic)的加州判决已给出一个关键区分:模型训练本身可能被认定为合理使用,但从盗版渠道下载无法合法获取的书籍则“本质上、不可挽回地构成侵权”。本案原告正是引用这一逻辑,主张 OpenAI 即便主张训练属于合理使用,也无从洗白其复制行为源自盗版源头。
这一案件的结果可能为大模型训练数据的合规性划出更清晰的边界:如果法院认定 OpenAI 需承担侵权责任,意味着所有依赖大规模抓取文本训练的闭源模型都可能面临系统性法律风险,AI 公司必须重新审计其数据供应链,并可能需要向版权方支付许可费用。这对“数据即壁垒”的行业竞争格局将产生直接冲击。
对用户/开发者/创作者的影响
对于内容创作者和出版行业而言,该案提供了对抗 AI 公司未经许可使用作品的法律支点——不再局限于证明生成内容构成抄袭,而是直接从训练阶段的盗版行为切入。若原告胜诉,作家、记者和独立内容生产者将获得更明确的谈判筹码,要求 AI 公司为训练数据付费。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
对于开发者与企业用户,此案提示了一个现实风险:即便 API 或开源模型的生成结果看起来“安全”,其底层训练数据的合法性争议仍可能波及相关商业应用。目前在合规敏感行业(如金融、法律、医疗)部署大模型的企业,可能需要更多关注底层模型提供方的数据治理记录。同时,如果法院最终要求 OpenAI 承担赔偿责任或强制删除特定训练语料,受影响模型的能力可能发生不可预期的变化。
值得关注的后续
OpenAI 在同日提交了交叉简易判决动议,主张其使用书籍属于法律意义上的合理使用,且复现原文内容的情况“极其罕见”。下一步值得关注三点:一是法官 Stein 如何权衡“合理使用”辩护与“盗版来源不可免责”这一矛盾;二是微软作为投资约 130 亿美元并深度参与 OpenAI 运营的合作方,其“替代责任”主张是否被法院采纳;三是本案与《纽约时报》、Daily News 等媒体方提交的合并简易判决动议是否会形成联动,推动法院对整个生成式 AI 训练数据问题做出一揽子裁决。


