一句话看懂:《纽约时报》诉 OpenAI 与微软版权案的新解封文件显示,微软高管私下把 AI 抓取训练数据称为”史上最大规模的劳动窃取”,OpenAI 内部也承认其聊天产品对出版商构成”生存威胁”。这些表态可能削弱两家公司一直依赖的”合理使用”抗辩。
事件核心:发生了什么
这起诉讼已持续三年。最新解封材料披露了几项关键内容:微软应用科学总监 Brent Hecht 在 2024 年 1 月的内部演示中,把 AI 抓取描述为”前所未有的惊人窃取”和”人类历史上最大规模的劳动窃取”,并称 Copilot 让《纽约时报》域名的点击率相比传统 Bing 搜索最多下降 93%,形成”末日循环”。
微软 CEO 纳德拉在今年的证词中表示,付费墙内容应获得授权才能用于训练或 grounding,若早知 OpenAI 抓取了付费墙后的数据,会要求其重新训练模型。OpenAI 方面,ChatGPT 负责人 Nick Turley 在内部沟通中称出版商面临”生存威胁”,总裁 Greg Brockman 则称模型”非常擅长新闻”。文件还首次披露,仅 OpenAI 的中训练数据集就包含超过 91,692 份 NYT、Daily News 等出版商的受版权作品副本,一个来自 Common Crawl 的数据集仅 nytimes.com 就超过 200 万份文档。
为什么重要
目前公开信息显示,法官在 AI 训练是否构成”合理使用”上整体偏向 AI 公司,特朗普政府本月初还提交简报支持 OpenAI 未经授权使用版权材料训练大模型。但本案的新披露直接触及合理使用四要素中最关键的一条——是否替代或损害原作市场。微软自己的数据证明 Copilot 大幅削减了原站流量,OpenAI 内部承认产品” largely substitutive(大体上具有替代性)”,这些都可能被法院视为不利于 AI 公司的证据。
对用户/开发者/创作者的影响
对内容创作者和出版商,这些文件强化了一个现实:AI 应用正在直接分流原本属于原站的流量与广告收入,付费墙和版权声明在训练阶段可能被绕开或剥离。对开发者而言,若法院最终收紧合理使用边界,依赖大规模网页抓取构建训练集或 RAG 索引的项目,合规成本会明显上升,API 与数据授权模式的重要性提升。对普通用户,短期内 ChatGPT、Copilot 等产品体验不会立刻改变,但若授权费用转嫁,部分 AI 服务的定价或内容覆盖范围可能调整。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
一是法院如何认定这些内部表态的证据效力,以及是否影响合理使用裁决;二是微软与 OpenAI 是否会在数据授权上加快与出版商的谈判;三是案件是否推动更多媒体采取诉讼或授权并行的策略,进而改变大模型训练数据的获取方式。


