民间团体敦促FTC就图书销毁起诉AI公司

多家美国民间团体敦促联邦贸易委员会(FTC)以反垄断为由调查 AI 公司批量购入并销毁实体书的行为,认为这实质上是在囤积训练语料,抬高竞争对手获取高质量数据的成本。

一句话看懂:多家美国民间团体敦促联邦贸易委员会(FTC)以反垄断为由调查 AI 公司批量购入并销毁实体书的行为,认为这实质上是在囤积训练语料,抬高竞争对手获取高质量数据的成本。

事件核心:发生了什么

据 Axios 报道,包括 Demand Progress Education Fund、美国消费者联合会(Consumer Federation of America)以及地方自力更生研究所(Institute for Local Self-Reliance)在内的十余个民间团体,已联名致信 FTC,要求其针对部分 AI 公司“购买并销毁实体书”的行为展开反垄断调查。此前 Mashable 曾报道,一些 AI 公司在训练具备智能体(agentic)能力的大模型时,会购入旧书后直接拆解销毁,以便扫描或翻拍书中内容作为高质量训练数据。

这些团体在信中指出,这类行为并非孤立的资料收集手段,而是 AI 巨头构筑“系统性护城河”的最新升级。尤其值得关注的是,被销毁的书籍多为 2022 年之前出版的老书——这批文本几乎不可能由 AI 生成,且经过严格编辑,是训练大模型稀缺的优质语料。每销毁一本实体书,市面上便少一本可供竞争对手或初创公司获取的语料源。

为什么重要

这起事件将 AI 训练数据的竞争从“版权争议”推向了“物理资源垄断”。以往行业争论的焦点是未经授权抓取网络文本,而“买书销毁”则意味着头部公司不仅拿到了数据,还主动减少了市场上同质数据的存在量。信函将此定性为“囤积并摧毁”(hoard-and-destroy)策略:通过抬高对手获取语料的成本,让新进入者难以在同等条件下训练出可与头部模型匹敌的大语言模型。

OpenAI CEO 山姆·奥特曼曾将知识比作“像电和水一样”可售卖的基础设施。但当这种“基础设施”的采集方式变成系统性销毁人类知识的主要载体时,这一商业叙事便暴露出反竞争底色。FTC 若受理此案,将可能把 AI 领域的反垄断审查从“并购控制”扩展到“训练数据独占行为”,对闭源大模型开发商依赖数据壁垒的商业模式构成直接挑战。

对用户/开发者/创作者的影响

对于开发者而言,这一动向意味着高质量中文或英文语料的市场流通量可能进一步收紧。如果头部公司通过物理销毁来独占旧书数据,开源社区和中小型 AI 团队在微调垂直模型时,获取优质长文本语料的成本将持续上升,开源模型与闭源模型之间的能力差距也可能被拉大。对于创作者和出版行业来说,大量绝版书被销毁意味着数字副本若未及时留存,人类知识资产将不可逆地流失。对普通用户而言,这关系到未来 AI 产品能否在常识推理、长文本理解上保持质量——如果训练数据来源愈发集中于少数公司,长期看模型输出的多样性和客观性也会受到影响。

值得关注的后续

目前公开信息显示,FTC 尚未正式回应是否立案。后续可重点观察三点:其一,FTC 是否会将这一行为纳入科技巨头反垄断调查的整体框架,并给出关于“数据排他性”的明确法律界定;其二,目标 AI 公司是否会调整数据采集方式,例如改用图书馆借阅扫描或直接购买数字版权,以规避监管风险;其三,该事件是否引发更多关于“训练数据来源透明化”的行业倡议,推动建立可供审计的数据获取规范,尤其是在多模态模型和推理模型对优质文本需求激增的背景下。

来源:Mashable

celebrityanime
celebrityanime
文章: 19713

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注