AI公司正在毁掉实体书——趁还来得及,赶紧扫描珍本

多家 AI 公司被曝通过中间商大量收购二手实体书,扫描后用于模型训练,随后将原书销毁。Anna's Archive 警告,这种行为正在让人类纸质知识永久退出公共领域,并呼吁全球志愿者赶在垄断形成前完成扫描和存档。

一句话看懂:多家 AI 公司被曝通过中间商大量收购二手实体书,扫描后用于模型训练,随后将原书销毁。Anna’s Archive 警告,这种行为正在让人类纸质知识永久退出公共领域,并呼吁全球志愿者赶在垄断形成前完成扫描和存档。

事件核心:发生了什么

据 Anna’s Archive 发布的客座文章披露,部分 AI 公司正在通过第三方渠道批量采购 2022 年以前的二手纸质书,扫描成数字文本后用于大模型训练,再将实体书销毁。文章点名 Anthropic 的“Project Panama”项目:该项目于 2024 年初启动,Anthropic 为此投入数千万美元,购入数百万册纸质书,扫描后用于训练 Claude 模型,最后统一销毁。该项目在 Anthropic 与版权方达成的 15 亿美元和解中被曝光。

文章作者指出,这种做法在法律上可能不违规,但对知识保存构成严重威胁。AI 公司销毁实体书之后,全球数字副本几乎被独家锁定在其私有服务器上,公共领域无法再获取这些内容。

为什么重要

这起事件揭示了一个矛盾:AI 公司一边承诺“让人类知识更可及”,一边正在拆解人类知识最稳固的物理载体。如果大量旧版书籍、期刊和珍本在扫描后被销毁,公共图书馆、学者和普通读者将永久失去访问这些内容的渠道。

从行业竞争角度看,谁先完成大规模扫描,谁就拥有独家的高质量训练语料库。这类语料不经过互联网二次传播,内容更干净、更接近原始文本,对模型训练质量有明显价值。但这也意味着,知识垄断可能从数字版权领域进一步延伸到物理世界的文献存续——AI 训练变成了知识资源的“圈地运动”,而非单纯的技术竞争。

与此同时,AI 生成内容正在快速淹没互联网。文章提到,自 2025 年初以来,新发布的互联网内容中超过一半由 AI 生成。如果人类写下的纸质文本被扫描销毁,未来互联网上剩下的将几乎全是 AI 的自我循环输出,人类文明的原生记录将变得稀缺。

对用户/开发者/创作者的影响

对普通用户而言,影响并不直观但足够深远:大量经典书籍、学术文献和历史资料可能从公共图书馆走向私有服务器,未来获取这些知识可能需要付费订阅或直接不可得。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对开发者与研究人员来说,训练语料的可获得性正在收窄。开源社区和学术机构如果无法获取这些被垄断的扫描文本,将在大模型训练数据上进一步落后于资金雄厚的闭源厂商。模型的“知识上限”可能由少数公司掌握,而非由公共知识库共同决定。

对创作者和出版行业而言,这一行为绕过了传统的版权授权体系,作者几乎无法从作品被扫描训练中获得任何收益。Anna’s Archive 在文章中特意提到,出版商未必能从这场垄断中真正获益,但作者获得的回报更少——知识被数字化,收益却没有回流到创作者手中。

值得关注的后续

第一,Anthropic 是否会在和解后公开“Project Panama”的扫描书目范围,以及是否承诺停止销毁实体书。目前公开信息显示,该项目的具体规模和涉及书籍清单尚未完全披露。

第二,Anna’s Archive 发起的志愿者扫描行动是否获得实质响应。文章提出的目标是全球 1000 万志愿者每人扫描一本书,这个规模是否可行,以及影子图书馆能否在出版商和 AI 公司完成“清场”之前抢下足够多的稀有文本,是值得观察的关键变量。

第三,这一事件是否会引发监管层面的讨论——扫描并销毁实体书是否构成对文化遗产的破坏,欧美版权法是否需要对“训练用扫描”作出新的限制。如果立法跟进,AI 公司的数据获取方式将面临更严格约束。

来源:Hacker News (黑客新闻)

celebrityanime
celebrityanime
文章: 19664

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注