一句话看懂:一篇讽刺小说以“销毁古董书专员”的视角,揭示了生成式 AI 公司为训练大模型而大规模采购、扫描并物理销毁珍稀纸质书的“破坏性扫描”行为。该话题因 Anthropic 版权诉讼中曝光的内部操作而引发热议,折射出 AI 训练数据饥渴与传统知识遗产保护之间的尖锐冲突。
事件核心:发生了什么
这篇发布在 McSweeney’s 的讽刺文章(作者 Jack Loftus,标注日期为 2026 年 8 月 28 日)以第一人称讲述了“图书销毁专员”的日常工作:公司购入古董书后,先切掉书脊、高速扫描成数字文件供 AI 大模型训练,随后将纸质残骸投入工业碎纸机或焚烧坑。文中提到,作者所在公司遵循“创始人领导文化”,强调以效率和规模为导向处理“库存问题”——即让唯一版本的书变为“可无限复制但订阅可见”的数字内容。
尽管文章是虚构创作,但引用了真实的背景:书评作者起诉 Anthropic 的版权案件中,解封的法庭文件显示该公司确实购买实体书、切除书脊以便高效扫描,然后销毁剩余部分,且试图保密。这并非孤例,多家头部 AI 实验室被曝通过批量采购旧书扩充训练语料,以应对高质量文本数据的枯竭。
为什么重要
这件事戳中了 AI 行业一个不愿被公开讨论的痛点:大模型训练的数据来源越来越“竭泽而渔”。当公开互联网文本被反复抓取后,闭源模型公司开始向实体古籍、绝版书、图书馆馆藏伸手。物理销毁唯一副本,意味着人类的原典遗产被降级为“可搜索的字节”和“混合纸屑”——数字副本的长期保存性、可访问性均受订阅制限制,而原始载体却永久消失。这在版权诉讼之外,提出了一个新的伦理与文化遗产问题:AI 进步是否必须以牺牲不可再生的知识载体为代价。
对行业而言,该话题也反映出训练数据供应链的野蛮生长:采购–扫描–销毁的流程缺乏透明度、行业标准和监管约束。如果 AI 公司能轻易沉默地处理稀有文献,那么公共图书馆、档案馆与商业 AI 之间的合作框架需要被重新审视。
对用户/开发者/创作者的影响
创作者与版权方:这篇讽刺文加剧了创作者对“作品被吞噬而无补偿”的担忧。尤其是古籍作者后人、学术机构,可能更谨慎地对待向 AI 公司授权或出售馆藏。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
开发者与研究者:依赖公开数据训练的团队会发现高质量语料越来越难获取,部分数据集可能流向闭源大厂,导致中小开发者与开源社区在数据层面进一步被拉开差距。目前公开信息显示,没有针对“破坏性扫描”的具体法律禁令,开发者需自行评估数据来源的合规风险。
普通用户:如果数字副本只存在于单一公司的订阅墙后,一旦平台调整策略或关停服务,人类的知识记录将面临真实缺口。这也提醒用户,对“云端永生”的数字内容应保持保存备份意识。
值得关注的后续
一是 Anthropic 相关诉讼的走向:法院是否会对“破坏性扫描”行为作出限制性裁决,或要求披露更多扫描细节;二是各大 AI 实验室是否因舆论压力,转而与图书馆、档案馆签署更正式的数字化合作协议;三是开源社区是否会发起“古籍抢救式扫描”项目,以提供不受订阅限制的替代数字版本。此外,观察是否有国家或机构启动针对“训练数据来源的物理载体保护”立法讨论,也将是关键信号。


