AI公司不断毁掉旧书,原因如下。

一家图书数据公司曾公开提供“毁书扫描”服务,通过切掉书脊、整本粉碎的方式来制作AI训练数据,引发强烈争议后已悄然撤回。此事揭开了大模型训练背后一个不愿被正视的现实:为了获取高质量文本,AI公司正在大量销毁实体书籍。

一句话看懂:一家图书数据公司曾公开提供“毁书扫描”服务,通过切掉书脊、整本粉碎的方式来制作AI训练数据,引发强烈争议后已悄然撤回。此事揭开了大模型训练背后一个不愿被正视的现实:为了获取高质量文本,AI公司正在大量销毁实体书籍。

事件核心:发生了什么

据 404 Media 报道,图书数据公司 ISBNdb 曾短暂上线一项“AI训练数据”服务,号称拥有“全球最大图书数据库”。该服务附带一个法律约束力的保密协议,原因写得很直白:“摧毁数百万本书会让人联想到焚毁图书馆……‘AI公司毁掉两百万本书’并不是一个能博取同情的标题。”其操作方式是把书脊切掉,将书页直接送入工业扫描机,扫描完成后纸张被回收处理。
该页面删除前被网友截图扩散,引发大量抗议,埃隆·马斯克也公开承诺 Grok 训练会以“困难的方式”处理稀有书籍,但未对普通书籍作出保证。ISBNdb随后声明已“放弃这一方向”,并称从未实际扫描过任何一本书。

这并非孤例。2025年6月美国地方法院法官 William Alsup 在一份裁决中披露,Anthropic 耗资数百万美元购买大量实体旧书,通过“Project Panama”计划拆开装订、裁切书页并高速扫描,随后丢弃纸质原件,用这些数据训练 Claude。Anthropic 此前已承认使用数百万本盗版书训练模型,并为此达成了创纪录的15亿美元版权和解。

为什么重要

这件事的意义不在“毁书”本身,而在于它暴露了AI训练数据供应链的真实状态。互联网上的公开文本已接近耗尽,书籍因其编辑质量高、逻辑连贯,成为大模型提升“聪明感”的优质养料。但对训练数据的追逐正在突破传统版权伦理的边界,Anthropic 的核心辩护是:销毁实体书后,等于用一份实体副本换一份数字副本,属于“转换性使用”。
法官在裁决中接受了这一说法,认定其构成合理使用。这一判定若成先例,意味着AI公司可以批量购买、销毁并转储受版权保护的书籍而无需授权,将深刻影响出版行业和创作者的议价能力。

对用户/开发者/创作者的影响

对创作者和出版方:如果“销毁换扫描”被认定为合理使用,版权方的授权谈判筹码将进一步被削弱。作者作品可能在没有协商的情况下进入训练集,且原书已被销毁,后续维权与追溯更难。法官判决中强调的“用实体副本置换数字副本”逻辑,也可能被其他公司复制。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对开发者与AI公司:目前公开信息显示,非破坏性的书籍扫描方案成本更高、速度更慢,在市场压力下,选择走捷径的公司可能不在少数。值得留意的是,若采用被曝光的盗版数据集(如Books3),将面临明确的侵权风险;而“购书销毁”路线在当前判例下反而获得了一定法律空间。

对普通用户:短期内不会直接影响产品体验,但长期看,训练数据来源的合法性和多样性会影响模型输出的可靠性。依赖少数几家公司垄断的“秘密数据”训练出的模型,在透明度上存在天然短板。

值得关注的后续

其一,Anthropic 的“Project Panama”是否已经停止,以及其训练数据透明度承诺是否兑现;其二,ISBNdb 虽然宣称未扫描过一本书,但 404 Media 数据显示稀有书籍收购价格出现异常上涨,不排除有其他供应商在保密协议下继续操作;其三,这起案件是否会进入上诉程序,以及合理使用判定能否被其他司法辖区采纳。后续若有任何一家主流AI公司被证实在持续销毁书籍,行业将面临新一轮声誉与法律压力。

来源:Mashable

celebrityanime
celebrityanime
文章: 18311

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注