一句话看懂:欧美二手书商近期频繁收到批量大额订单,大量绝版书和冷门书籍被运往不明仓库。业界猜测这些书并非卖给普通读者,而是被AI公司买去用于大模型训练——2025年美国一起版权判决已为这类行为开了绿灯。
事件核心:发生了什么
据BBC报道,过去几个月,全球多家独立二手书店出现异常大单。英国诺森伯兰郡Barter Books老板Stuart Manley从业30年,此前单周销量约两三千本,但近期一家加拿大公司的一次性采购量就相当于过去一周的总销量。伦敦Walden Books、爱丁堡McNaughtan’s等书店也报告了类似情况。订单书目非常随机,既有冷门拉丁文古籍,也有牛仔小说,买家去向不明。
这一现象被怀疑与AI训练数据需求有关。2025年,美国法官William Alsup在Anthropic被三位作者起诉的案件中裁定,使用购买的书籍训练AI不违反美国版权法,理由是“具有高度变革性”。后续公开的法院文件显示,Anthropic内部曾将相关项目称为“Project Panama”,目标包含“破坏性扫描世界上所有书籍”——即拆掉书脊、高速扫描后再回收剩余纸张。Anthropic发言人表示训练数据来源多样,并强调“没有采购并销毁珍稀或古董书”,但二手书商仍对这种处理方式感到不安。
为什么重要
这个现象很可能是AI行业获取高质量训练数据的真实写照。大模型竞争已经从公开网络文本转向更稀缺、更结构化的内容源,绝版书、学术专著和冷门出版物往往不在常见数据集内,却能提供差异化的语料价值。美国的判决进一步降低了AI公司购买和数字化实体书的版权风险,而“破坏性扫描”则说明这已经不是小规模试水,而是工业化、批量化的数据采集。
对版权规则而言,这也暴露了地区差异。牛津大学知识产权专家Emily Hudson指出,英国法律与美国不同,在英国建立训练语料库并进行复制,原则上需要版权人许可。所以同样一批书,在美国可能合法,在英国或欧洲则可能面临完全不同的合规判断。
对用户/开发者/创作者的影响
对创作者和出版行业来说,这意味着作品可能在没有直接授权的情况下进入AI训练流程,而且实体书被扫描后可能不再流通。二手书商陷入两难:一方面订单带来了多年未见的收入,另一方面却担心珍稀版本被销毁。对AI开发者而言,这个新闻提醒了一个实际风险:训练数据的获取渠道和地域合法性需要仔细审查,尤其是跨国采购实体书这类灰色地带操作,一旦监管收紧,很可能影响后续模型的训练成本与合规路径。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
对普通用户来说,短期内不会直接感知到变化,但大模型通过消化这些实体书可能获得更强的长尾知识能力,尤其是在历史、文学、小众学科等领域的回答质量上。不过,如果“破坏性扫描”成为普遍做法,一些原本罕见但存世量极少的书籍可能会加速从市场上消失,文化意义上的损失难以用模型性能提升来抵消。
值得关注的后续
目前公开信息显示,Anthropic未确认“Project Panama”是否仍在运行,也没有证据表明所有二手书大单都流向AI公司。后续可以观察三点:一是美国法院判决是否会成为其他AI公司大规模收购实体书的依据,从而进一步推高二手书市场的异动;二是英国或其他司法管辖区是否会出现针对此类行为的版权诉讼或监管回应;三是Anthropic等公司是否会公开更多关于训练数据来源的细节,或调整数据采购方式以避免珍稀书籍被破坏。


