AI公司正把旧书变成训练数据,Fahrenheit 451式

AI公司开始绕过已经“被污染”的互联网,跑到二手书店批量收购旧书,甚至通过破坏性扫描把实体书变成大模型训练数据。这解释了为什么近期美国、欧洲二手书市场出现异常大宗采购,也把AI训练的版权争议从线上烧到了线下。

一句话看懂:AI公司开始绕过已经“被污染”的互联网,跑到二手书店批量收购旧书,甚至通过破坏性扫描把实体书变成大模型训练数据。这解释了为什么近期美国、欧洲二手书市场出现异常大宗采购,也把AI训练的版权争议从线上烧到了线下。

事件核心:发生了什么

据Mashable报道,经营在线图书数据库的ISBNdb公司曾在其官网上宣传一项服务:可为AI开发者一次采购最多100万本实体书,并“根据您的LLM训练需求定制选书”,重点覆盖旧版、专业、稀有和绝版书目。该页面已于7月28日删除,公司事后回应称这只是在“探索需求”,现已“决定放弃这一方向”。

真正引发关注的是两件事:一是ISBNdb承诺在每笔交易中签署严格NDA,不披露客户身份与采购策略;二是将实体书转化为训练数据通常需要破坏性扫描——切掉书脊、把散页送入工业扫描仪,原件随后被丢弃或回收。这种高度保密且消耗实体书的做法,让外界重新审视AI公司的数据来源。

这并非孤例。联邦法院记录显示,Anthropic曾购买并扫描了数百万本实体书;美国及欧洲的二手书商也报告过针对冷门绝版书的异常批量订单。这些零散信息共同指向一条正在成形的新供应链:把未经AI“污染”的人类写作从旧书市场搬运进训练集。

为什么重要

大模型训练依赖海量文本,但互联网上AI生成内容占比不断上升。如果模型大量学习此前模型产出的文本,会逐步放大错误、丢失原始数据中的多样性和长尾信息,研究者称之为“模型崩溃”或“模型自噬”。旧书恰好提供了一个相对纯净的来源:它们写于AI热潮之前,经过编辑和出版流程,内容结构完整且包含许多网上找不到的专业知识。

这个现象的意义在于,AI行业的数据策略正在从“最大化抓取线上语料”转向“争夺线下稀缺的人类文本”。旧书成为继网页、代码仓库之后的又一重要数据资产,而围绕它的保密采购、破坏性扫描和版权问题,把此前Google Books时期的数字图书馆争议重新带回公众视野——只不过这次的需求方换成了大模型公司,诉求也从“让书籍可搜索”变成了“提取文本喂给AI”。

对用户/开发者/创作者的影响

对开发者而言,使用这类数据训练的模型可能在知识密集型和长尾专业问题上表现更好,但训练数据来源的合法性和伦理问题也会随模型发布被放大,部署时需更加审慎。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对作者和出版方来说,旧书被批量扫描训练意味着版权保护出现了新的灰色地带——尤其是绝版书和二手书,原作者往往不知情,也几乎没有授权渠道。Google Books案中法院曾判定扫描用于搜索索引属于合理使用,但直接采入商业模型的训练集是否适用同一标准,目前尚无明确判例。

对普通用户而言,短期内感受最直接的变化可能是二手书市场价格波动——某些品类的绝版书可能因AI采购而涨价。更长期看,用户使用AI产品时可能会注意到模型对老书知识的引用明显增多,但很难追溯这些内容是否经过了合法授权。

值得关注的后续

目前公开信息显示,ISBNdb已撤下相关页面,但Anthropic等主要玩家的采购行为仍处于法律事实查明阶段。接下来有几点值得跟踪:

一是版权诉讼风险。创作者或出版商是否会针对实体书扫描训练提起新诉讼,将直接影响这条数据管线是否合法可行。

二是二手书市场连锁反应。AI公司的批量采购是否推高旧书价格,以及更多公司是否跟进并建立自己的线下采购渠道。

三是技术替代方案。业界是否会转向与出版商或作者直接授权合作,用合规方式获取高质量真实人类文本,替代这种隐秘而破坏性的“扫书”模式。

来源:Mashable

celebrityanime
celebrityanime
文章: 16145

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注