一句话看懂:《纽约时报》诉 OpenAI 与微软案中最新解封的 92 页法庭文件显示,两家公司内部早就把抓取全网数据训练大模型形容为“人类史上最大规模的劳动窃取”,并预判这会触发伤害整个网络的“末日循环”,却仍然照做。
事件核心:发生了什么
这些文件来自《纽约时报》对 OpenAI 和微软的版权诉讼,近日被解封。其中最受关注的说法出自微软应用科学总监 Brent Hecht:他把 ChatGPT 和 Copilot 大规模抓取内容称为“人类历史上最大规模的劳动窃取”,并认为微软的合理使用抗辩是“对‘合理使用’这一概念的彻底嘲弄”。微软回应称这些只是员工个人观点,不代表公司立场,并在另一份文件中把 Hecht 描述为持“学术化、前卫”异议视角的人。
文件还提及,微软内部文档承认其 AI 内容策略“开启了一个末日循环”,会同时损害自家模型和整个网络;萨提亚·纳德拉承认聊天机器人已基本取代搜索入口;OpenAI 联合创始人格雷格·布罗克曼则公开谈及商业化 AI 可能带来的巨额收入。此外,一名 OpenAI 代表表示“不知道”是否有机制识别或剔除训练数据中的付费墙内容,而员工内部承认 GPT-4“记住了大量数据,因此在逐字复述方面强得离谱”。
为什么重要
这批材料的价值不在于又一起版权纠纷,而在于它把“AI 吞噬内容生态”从外界批评变成了公司内部的自认。内容供给是大模型训练与推理的上游,如果创作者和出版商因流量与收入被抽走而减少产出,模型可获取的高质量语料也会萎缩——微软自己就写道,大模型是“一个摧毁自身供应链的产品”。这意味着问题不只是法律风险,而是当前闭源大模型商业模式的可持续性。
对用户/开发者/创作者的影响
对创作者和出版商,文件直接指向付费墙内容被用于训练、聊天机器人给出答案后“没有理由再点击来源链接”的现实,Google Zero 式的零点击环境可能进一步固化。对开发者,这提示依赖公开网页数据做微调或检索增强的路径会面临更严的授权与合规审查,使用受版权保护的语料需要更谨慎的数据溯源。对普通用户,短期内聊天机器人仍会“好用”,但可检索、可引用的高质量信源可能变少,答案的可靠性也会受影响。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
一是法院如何看待“合理使用”与训练数据授权的边界;二是 OpenAI、微软是否会与更多出版商达成付费授权,以及是否上线可检测并剔除付费墙内容的机制;三是其他大模型厂商是否被牵出类似内部文件,进而推动行业形成统一的数据来源披露规范。目前公开信息显示,这些内部判断尚未转化为产品层面的明确整改。
来源:The Verge


