一句话看懂:最新解密的法庭文件显示,微软应用科学总监 Brent Hecht 在 2023 年内部备忘录中把 AI 抓取数据称为“人类历史上最大规模的劳动力盗窃”。这一表态来自《纽约时报》起诉微软与 OpenAI 的版权案,也暴露出 AI 大模型训练数据来源的合法性问题正被自家高管“实锤”。
事件核心:发生了什么
据 TechRadar 援引 TechCrunch 报道,在一份 2023 年 1 月的内部备忘录中,微软应用科学总监 Brent Hecht 将 AI 抓取数据描述为“史无前例的惊人盗窃”。他警告生成式 AI 存在“真实风险”,可能冲击那些在不知情情况下为模型提供了训练数据的人群的就业,并将其定性为“人类历史上最大规模的劳动力盗窃”。
这些内容出自《纽约时报》2023 年对微软和 OpenAI 提起的诉讼。该案指控两家公司在未经许可的情况下复制并使用其受版权保护的作品。文件还显示,微软内部研究发现,Copilot 相比 Bing 传统搜索,可能让《纽约时报》的点击率下降多达 93%。Hecht 为此提出了“末日循环”理论,即大模型可能反噬自身的内容供给链。目前公开信息显示,微软 CEO 萨提亚·纳德拉曾承认,若早知 OpenAI 抓取了付费墙后的数据,他会行使权利要求 OpenAI 重新训练模型、排除这些受保护数据。OpenAI 方面则被指在素材进入大型数据集前移除版权声明,以避免模型向用户重新生成这些信息。
为什么重要
这起案件的看点不只是赔偿金额,而是它把 AI 行业长期回避的问题摆上台面:大模型的训练数据究竟从哪来、是否合法、有没有获得授权。如果法院最终认定未经许可的抓取不构成合理使用,那么依赖公开网络数据训练的闭源和开源模型都会面临重新训练或授权成本,算力与数据合规将直接推高模型开发门槛。另一方面,美国特朗普政府近期在相关声明中表态支持 AI 开发者,认为在误解合理使用原则的情况下限制大模型发展,会妨碍美国的创意与科学进步。这意味着版权方与 AI 公司之间的拉锯,短期内不会靠单一判决收场。
对用户/开发者/创作者的影响
对内容创作者和出版机构来说,Copilot 可能让《纽约时报》点击率下降 93% 的数据,说明生成式 AI 正在替代传统搜索的导流角色。如果内容被大模型直接消化、用户不再回访原站,广告和订阅收入的基础会被削弱。对开发者而言,使用 API 或自建大模型时,训练数据与推理输出的版权风险会越来越难忽略,尤其在面向美国市场时,合规审查可能成为产品上线前的必要环节。对普通用户,短期内聊天机器人和 AI 搜索的体验不会明显变化,但长期看,若版权方胜诉或达成授权协议,部分内容可能被排除在模型之外,AI 回答的完整度和时效性会受到影响。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
一是《纽约时报》诉微软和 OpenAI 案的判决走向,尤其是合理使用抗辩能否成立;二是 OpenAI 是否会被要求删除或重新训练包含受版权保护内容的数据集;三是其他出版机构是否会跟进诉讼或与 AI 公司达成授权合作,从而改变大模型训练数据的获取方式。
来源:TechRadar


