Microsoft court filings: an expert hired by publishers found that only ~60K of 8.2M Copilot chat logs contained at least 16 words in common with news content (Lauren Feiner/The Verge)

微软在版权诉讼中提交的法庭文件显示,出版商聘请的专家在约820万条Copilot聊天记录中,仅发现约6万条与新闻内容存在至少16个词的实质性重合,占比不足1%。这一数据可能成为AI厂商在生成式AI版权纠纷中的关键抗辩依据。

一句话看懂:微软在版权诉讼中提交的法庭文件显示,出版商聘请的专家在约820万条Copilot聊天记录中,仅发现约6万条与新闻内容存在至少16个词的实质性重合,占比不足1%。这一数据可能成为AI厂商在生成式AI版权纠纷中的关键抗辩依据。

事件核心:发生了什么

据The Verge记者Lauren Feiner报道,微软在对抗多家新闻出版商的版权诉讼中提交了新的法庭文件。文件引用了出版商方面聘请的专家分析结果:在对约820万条微软Copilot(含聊天助手及配套AI搜索功能)日志的审查中,仅有约6万条对话包含与新闻文章内容高度相似的连续文本片段,判定标准为至少16个连续单词与受版权保护的新闻内容重合。该部分对话在总样本中占比约为0.73%。

该案涉及的核心争议在于,微软将基于大语言模型的生成式搜索和聊天功能集成进Bing及Copilot后,在回应用户请求时是否构成对新闻机构版权的系统性侵害。值得注意的是,这份数据的挖掘与统计工作由原告方(出版商)聘请的专家完成,并非微软自行选择的分析口径,这使得数据在诉讼博弈中具有一定程度的原始证据属性。

为什么重要

这一披露为生成式AI的版权合规争论提供了罕见的量化视角。此前,新闻集团、纽约时报等机构与OpenAI、微软之间的诉讼多聚焦于训练阶段的数据抓取,而本案涉及的Copilot聊天记录则指向了推理与生成阶段——即大模型在实际输出内容时是否大规模“复述”了版权材料。

如果该数据在交叉质询中被法庭采信,将表明当前主流的AI搜索与聊天产品在绝大多数交互中并未机械复制新闻原文,而是在进行较高程度的语义重写与信息摘要。这一逻辑将显著影响法院对“合理使用”及“实质性相似”的认定,并可能改变未来AI搜索产品的合规设计基准。当然,原告方可能反驳称6万条侵权记录已构成可观的商业损害,并强调绝对数量而非比例才是赔偿计算的关键。

对用户/开发者/创作者的影响

对于依赖内容生产的创作者和新闻机构,该数据意味着追究AI输出侵权的法律门槛依然存在——版权方不能仅凭大模型“接触过”训练语料就推定其输出必然侵权,而是需要找到能够被认定为非法的“具体表达”证据。这要求维权方在技术监测和取证上投入更多资源。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对于AI应用开发者和企业采购方,本案凸显了在对话式产品中引入内容来源引用(Citation)机制的必要性。即便侵权输出概率极低,在面向新闻、图书等高价值文本领域的商业部署中,通过检索增强生成(RAG)限定输出范围,或增加原创性护栏,仍是降低法律风险的有效手段。个人用户则无需过度担忧日常使用Copilot会导致复制粘贴式的原文摘录,但应保持对生成内容准确性和版权来源的基本甄别意识。

值得关注的后续

目前公开信息显示,该案仍在审前证据交换阶段。后续需要观察的包括以下三点:一是微软是否会引用这一比例数据作为“合理使用”的核心抗辩,并申请即决判决以规避漫长陪审团审理;二是出版商方面是否会提交针对这6万条记录的逐条侵权认定分析,将争议焦点从“占比多少”转向“这些具体输出是否构成市场替代”;三是该案结果对OpenAI、谷歌等正在与版权方进行授权谈判的其他大模型厂商会产生多大程度的溢出效应——尤其是在Copilot与ChatGPT等产品均已开始引入实时联网检索功能的竞争背景下。

来源:Techmeme

celebrityanime
celebrityanime
文章: 22094

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注