一句话看懂:AI 公司为规避版权风险,正在大规模采购并销毁实体珍本书籍,以获取未公开的独有训练数据。批评者认为这可能导致人类知识库的永久性缺口,呼吁企业在扫描后保留公开存档。
事件核心:发生了什么
据 Hacker News 讨论及 Ars Technica 报道,当前部分 AI 公司正通过购买市面上的稀有、绝版或小印量实体书,在扫描入库后销毁原书,以确保这些文本内容不会进入其他竞争对手或公开互联网的训练集。这种行为被视为版权高压环境下的“数据独占”策略。今年 6 月有报道指出 Anthropic 也曾涉及类似销毁实体书的行为,引发版权与档案保护争议。
评论者指出,以 50 美分一本的价格在跳蚤市场出售的书,绝大部分本身面临自然腐烂或被丢弃的命运。AI 公司收购的往往只是单一副本,并不会垄断所有存量。但问题在于,如果其为独占数据而刻意销毁特定珍本或绝版书,则可能酿成类似“亚历山大图书馆被烧”的历史遗憾——人类将失去部分不可再生的原始知识。
为什么重要
这一现象的本质,是 AI 训练数据“高公地”与“高围墙”之间的冲突。公开互联网的文本已快被大模型榨干,寻找未数字化、未公开的物理书刊成为获取高质量语料的最后洼地。为此,部分公司宁愿买书烧书,也要把数据锁进自家保险柜。
从历史角度看,这种“有限幸存”的数据采集方式将直接影响未来模型的知识广度。即便这些书中的内容未必都高价值,但作为前机器学习时代的人类创作遗产,其档案价值不可低估。而目前公开信息显示,相关企业在扫描后并未建立公示或公共存档机制,这意味着数据可能随着原书销毁而永久消失,而非被妥善保存。
对用户/开发者/创作者的影响
对普通用户:短期内不易察觉,但长期看,你在 AI 生成内容中能获得的知识范围,将被少数几家公司持有的物理扫描库所定义。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
对开发者与研究者:若追求使用小众、绝版书籍训练模型,获取成本将大幅上升;同时也意味着开源社区在语料层面与闭源公司的代差可能被拉大。
对创作者与作者:书籍若能进入 AI 训练集,其内容将以某种形式“数字化永生”;但若版权方或 AI 公司选择独占销毁,则是另一种意义上的彻底消失。创作者的权益分配仍缺乏明确规则。
值得关注的后续
一是,关注 Anthropic、OpenAI 等头部公司是否会效仿并通过购买销毁方式建立“私有语料库”,以及是否有公开声明来回应质疑。二是,关注是否有第三方机构(如图书馆联盟、互联网档案馆)出面要求 AI 公司留存扫描副本或建立公共存取机制。三是,版权法是否会针对“购买后销毁纸质书以消除训练来源”的行为出台专门约束,这将直接影响各大模型厂商的合规成本。
来源:hackernews


