反人类的文化罪行?AI公司销毁珍稀书籍,让别人再也读不到

为了获得“干净”的AI训练数据,部分AI公司正在批量采购并销毁2022年前出版的书籍——包括一些存世极少的珍本——用切掉书脊、高速扫描的方式把它们变成数字数据。这件事引发了对不可逆文化损失的广泛担忧。

一句话看懂:为了获得“干净”的AI训练数据,部分AI公司正在批量采购并销毁2022年前出版的书籍——包括一些存世极少的珍本——用切掉书脊、高速扫描的方式把它们变成数字数据。这件事引发了对不可逆文化损失的广泛担忧。

事件核心:发生了什么

据404 Media报道,数据供应商ISBNdb正在以匿名方式向AI实验室批量供应实体书籍,总量可达数百万本。这些书之所以被看重,是因为它们出版于2022年之前,早于AI生成内容大规模扩散的时间点,文本中不包含chatbot生成的杂质,被认为是“密集、经过编辑、有权威性”的训练语料,有助于降低模型训练中的“模型坍缩”风险。此外,旧书也能天然规避作者针对AI训练植入的数据投毒。

问题出在数字化方式上。为了降低成本并提高扫描速度,加工方需要先切掉书脊、拆散页面再送入自动扫描设备,这意味着每一本被扫描的原版书都会被物理销毁。由于项目与客户之间签有严格保密协议,外界难以追溯具体流入哪些实验室。唯一可以确认的是,Anthropic在涉及版权扫描的法律纠纷中,曾获得法院在特定条件下将“购买后扫描训练”认定为合理使用的裁决,理由是销毁原件意味着“取代”一本合法副本而非复制多份。

为什么重要

这是AI训练数据获取模式的一种极端走向:大模型公司为了对抗“用AI生成内容训练AI”的质量衰退,转而把目光投向实体旧书市场。商业逻辑可以理解,但规模令人不安。有受访书商指出,部分进入扫描流程的书在经历了战争、火灾和数百年流通之后,存世本就稀少,一旦实体本消失,数字版本就成了唯一残留,而扫描过程本身还可能存在脱页、裁切错误等问题。

更有批评者直言,这种规模的损毁已经超过了历史上著名的亚历山大图书馆焚毁事件。更关键的是,尚不清楚这些数据集未来是只用于训练内部模型,还是会形成可共享的数字资产。如果只是封闭地喂给大模型,那公众失去的将不仅是纸张本身,还有对这些内容进行独立研究、查阅和再版的可能性。

对用户/开发者/创作者的影响

对普通用户来说,短期内这些旧书的内容会以更碎片化的方式“内化”到新一代大模型的回答中,但用户将失去与原始文本直接接触的渠道,尤其是那些从未被数字化过的珍稀文献。对开发者而言,这个案例提醒我们,训练数据供应链存在着隐蔽的伦理灰色地带——购买数据时,验证“来源是否合法”不等于“来源是否可持续”。对于书籍作者和历史文献的研究者来说,这意味着即便你的书被合法购买,它仍可能被物理销毁,版税照付但不代表作品能以公共可访问的形式存续。Elon Musk回应一位批评者时表示,他已要求SpaceX AI团队把珍稀书籍先行入库保存、再用更保守的方式扫描,这说明行业内也存在分歧。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

以下几点值得跟踪:第一,Anthropic案关于“合理使用”的法院裁决是否会被上诉推翻,或者形成更清晰的判例边界;第二,ISBNdb是否会因为舆论压力修改保密条款或扫描方式;第三,是否会有第三方机构成立专门的“珍稀书籍保护清单”,对进入AI训练管线的存量旧书进行过滤。目前公开信息显示,尚未有明确的监管或行业标准约束此类行为,这场围绕训练数据来源的博弈,远未结束。

来源:TechRadar

celebrityanime
celebrityanime
文章: 16453

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注