大模型成最大“抄袭者”?全球最大生活指南百科 WikiHow 正式起诉 OpenAI 侵权

全球最大生活指南百科 WikiHow 正式起诉 OpenAI,指控其未经授权抓取超过 11,000 篇教程文章用于训练 GPT 系列大模型,涉嫌侵犯至少 1,200 项已注册版权。这起诉讼将成为衡量大模型训练数据合规边界的关键判例。

一句话看懂:全球最大生活指南百科 WikiHow 正式起诉 OpenAI,指控其未经授权抓取超过 11,000 篇教程文章用于训练 GPT 系列大模型,涉嫌侵犯至少 1,200 项已注册版权。这起诉讼将成为衡量大模型训练数据合规边界的关键判例。

事件核心:发生了什么

据 AIbase 报道,WikiHow 已在美国纽约南区联邦地区法院对 OpenAI 提起诉讼。诉讼焦点在于,OpenAI 在未获许可的情况下,抓取了 WikiHow 平台上涵盖日常生活技能到专业技术领域的超过 11,000 篇教程文章,用于训练 ChatGPT 及 GPT 系列大语言模型。WikiHow 在诉状中指出,经过这些教程数据“投喂”后,ChatGPT 现在能够根据用户提示直接复现其文本内容,并自主生成类似主题的完整教程,导致用户无需访问原始网站即可获得答案。

目前公开信息显示,OpenAI 发言人对此回应称,其 AI 模型完全基于公开可获取的数据进行训练,并援引“合理使用”(fair use)的法律原则作为抗辩依据。WikiHow 方面暂时未对该回应作出进一步公开评论。

为什么重要

这起诉讼的意义远超单一版权纠纷,它直击大模型产业最核心的合规痛点:训练数据的来源合法性。此前,针对 AI 训练数据侵权的诉讼多集中在新闻机构、图片库或作家群体,而 WikiHow 作为大型协作式内容平台,其内容具有高度结构化、步骤化特点,恰好是 AI 教程生成能力的重要训练来源。

如果法院认定 OpenAI 的行为不构成“合理使用”,将直接动摇当前主流大模型公司依赖公开数据训练的商业模式基础。这可能迫使 OpenAI 及其他模型厂商在训练数据采集、授权协议和内容溯源机制上做出根本性调整,进而影响整个 AI 行业的训练成本和数据获取方式。从商业角度看,WikiHow 明确指出,AI 直接复现教程内容降低了用户访问原始网站的意愿,切断了其核心流量与收入来源,这种“用 AI 替代人类劳动”的路径依赖若被认可,将削弱内容创作者持续产出的经济动机。

对用户/开发者/创作者的影响

对于普通用户,短期内 ChatGPT 等产品的教程生成能力不会立即受到影响;但若诉讼结果不利于 OpenAI,未来大模型在处理类似结构化内容时可能会受到更多限制,回答的完整性和直接性可能下降。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对于开发者而言,此案结果将直接影响 API 调用成本和应用层产品设计。若 OpenAI 被迫承担高额赔偿或停止使用相关训练数据,其合规成本会转嫁到 API 定价上;同时,开发者在构建依赖教程类内容的 AI 应用时,也需要更加审慎地评估数据来源的法律风险。

对于创作者和内容平台,这是一个重要的信号:单纯依赖“公开数据”并不自动等于“可自由使用”。WikiHow 的诉讼为其他内容平台提供了维权范本,可能催生更多针对 AI 训练数据使用的集体诉讼或授权协议谈判,从而改变内容方与模型厂商之间的权力平衡。

值得关注的后续

此案仍有多个关键节点值得跟踪:

第一,法院对“合理使用”抗辩的初步态度。美国法院此前在类似案件中(如针对谷歌的图书扫描案)倾向于支持合理使用,但 AI 大模型的商业化应用场景可能改变这一判断,法官如何区分搜索引擎的摘要展示与 AI 的全文复现将是关键。

第二,OpenAI 是否会主动与 WikiHow 达成庭外和解或授权协议。考虑到诉讼对行业信心的冲击,OpenAI 可能倾向于以商业合作方式化解纠纷,这将成为其他内容平台与 AI 公司谈判的参考基准。

第三,对开源模型生态的连带影响。目前多数开源模型同样依赖大规模抓取数据进行训练,如果此案确立更严格的版权保护标准,开源社区的数据清洗和合规审查成本也将上升,可能间接影响后续开源模型的发布节奏和能力上限。

来源:AIbase

celebrityanime
celebrityanime
文章: 20130

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注