‘Unlicensed, unrestricted AI training could destroy the ecosystem for books’ — quote of the day by the Authors Guild on the sourcing of training data

美国作家协会(Authors Guild)公开警告,AI 公司未经授权、不加限制地扫描书籍用于大模型训练,长期可能摧毁图书出版生态。该表态源于 Anthropic 被曝光的“Project Panama”项目——该公司计划大规模购买并扫描实体书来训练 Claude。

一句话看懂:美国作家协会(Authors Guild)公开警告,AI 公司未经授权、不加限制地扫描书籍用于大模型训练,长期可能摧毁图书出版生态。该表态源于 Anthropic 被曝光的“Project Panama”项目——该公司计划大规模购买并扫描实体书来训练 Claude。

事件核心:发生了什么

TechRadar 报道,美国作家协会针对 AI 公司使用书籍训练大模型的行为发布了详细的 AI 授权指导文件,并给出严厉警告:“未经授权、不受限制的 AI 训练可能长期摧毁图书生态系统,版权例外不应扩展到破坏版权法根本目的的程度。”

这一表态的直接导火索是法庭文件中曝光的 Anthropic“Project Panama”计划。该项目旨在“破坏性地扫描世界上所有的书”,公司内部使用代号是因为“不想让别人知道我们在做这件事”。为了获得高质量训练数据,Anthropic 选择工业级采购实体书籍——相比网络文本,书籍的写作质量明显更高,更适合训练 Claude 这类大语言模型。

在此之前,业界已有多起 AI 公司被指使用盗版电子书网站内容训练模型的传闻,引发了作家、作者和出版商的公开抗议。美国作家协会的指导文件覆盖了 AI 公司使用出版物的各种形式,并从法律角度阐述了其合法性判断。

为什么重要

这件事触及大模型训练数据来源的核心争议:AI 公司为了获取高质量语料,正在系统性地绕过版权授权体系。Anthropic“Project Panama”采用代号和秘密操作的做法,说明公司内部清楚这种大规模扫描行为存在法律和道德风险。

对 AI 行业而言,问题不仅在于法律合规性,更在于商业模式可持续性。如果高质量书籍数据被大规模、无授权地纳入训练集,未来版权方对 AI 公司发起集体诉讼或推动严格监管的可能性将显著上升。这也会倒逼 AI 公司重新评估训练数据的获取方式——无论是转向付费授权、合成数据,还是寻找其他高质量文本来源。

从竞争格局看,能够合法获得高质量数据并建立合规训练流程的公司,将在长期竞争中占据优势;而依赖灰色渠道获取数据的玩家,则面临法律和声誉的双重风险。

对用户/开发者/创作者的影响

对内容创作者和出版行业来说,这是一个直接的生存威胁。如果 AI 公司可以无偿、大规模地使用书籍训练模型,创作者的劳动成果将失去商业价值,长期可能导致优质内容供给减少。作家协会的立场很明确:版权例外不应成为 AI 公司免费获取内容的通行证。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对开发者和 AI 应用开发者而言,这一事件提示了一个现实:训练数据的合法性和可追溯性正在成为评判模型质量的重要维度。选择使用哪些大模型 API 或开源模型时,需要关注其训练数据的合规状况,否则下游应用可能面临版权纠纷风险。

对普通用户来说,短期内影响是模型可用性和内容质量的平衡。如果严格版权合规导致高质量书籍数据减少,模型在文学性写作、深度知识问答等场景的表现可能受限。长期来看,用户为 AI 服务支付的费用中,可能包含更多用于内容授权的成本。

值得关注的后续

目前公开信息显示,Anthropic 尚未对“Project Panama”的曝光做出正式回应。后续值得关注三点:一是 Anthropic 是否会调整 Claude 训练数据获取策略,转而与出版社建立正式授权合作;二是美国作家协会的授权指导文件是否能推动行业形成统一的版权授权标准和定价机制;三是法院或监管机构是否会对 AI 公司使用版权书籍训练模型的行为做出新的司法界定。版权诉讼的结果可能直接改变 AI 训练数据市场的游戏规则。

来源:TechRadar

celebrityanime
celebrityanime
文章: 20094

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注