404 媒体报道后,公司停止提供培训人工智能的印刷书籍

图书数据公司 ISBNdb 在被科技媒体 404 Media 曝光后,撤下了“出售印刷书用于 AI 训练”的营销页面,并澄清该服务从未真正落地。此事折射出大模型训练数据来源的敏感性与版权合规压力。

一句话看懂:图书数据公司 ISBNdb 在被科技媒体 404 Media 曝光后,撤下了“出售印刷书用于 AI 训练”的营销页面,并澄清该服务从未真正落地。此事折射出大模型训练数据来源的敏感性与版权合规压力。

事件核心:发生了什么

据 404 Media 报道,图书数据库公司 ISBNdb 此前在官网提供一项名为“Printed Books Sourcing for Your AI LLMs Dataset Needs”的服务,宣称可以批量采购 2022 年以前的印刷书籍,供 AI 公司扫描后用于大模型训练。其卖点是这些书籍包含“经过筛选的人类知识”,且没有 AI 生成文本污染,也不受当代数据投毒手段影响。该公司还提出可通过 NDA(保密协议)进行“谨慎”的大宗采购,并承认外界可能对“AI 公司为扫描而销毁数百万本书”存在负面看法。

报道发出九天后,ISBNdb 删除了该落地页(7月28日),并于7月30日在首页和新闻页发布声明,称“从未购买、扫描或出售过任何一本书”,也从未训练过 AI 模型,该页面只是“对市场兴趣的测试”。公司强调核心业务仍是图书元数据 API,帮助书店、图书馆和阅读应用连接读者与书目。

为什么重要

这一事件的意义不在 ISBNdb 本身,而在于它揭示了 AI 数据获取链条中的两个关键张力:一是高质量人工语料的稀缺性——2022 年以前的印刷书被认为是少数未被 AI 生成内容“污染”的语料来源;二是版权与公众观感的红线。尽管该公司否认真正开展过该服务,但“将实体书扫描为训练数据”的设想本身,就足以触发出版业、作者群体和 AI 合规层面的强烈反应。它表明,在大模型竞争从模型架构转向数据质量的当下,任何涉及版权的数据采集方案都会面临比以往更严格的舆论审视。

对用户/开发者/创作者的影响

对于开发者与企业:如果依赖第三方数据服务商获取训练语料,需要重新评估供应方的版权链条是否清晰,类似 ISBNdb 这样“先出营销页、再撤回”的情况,可能意味着高风险数据源正在主动退出市场,合规数据成本会进一步上升。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对于创作者与出版方:此事件是一个信号——公众和媒体对 AI 公司获取受版权保护内容的容忍度正在降低。即使数据中间商试图通过 NDA 隐藏采购细节,曝光风险依然存在。创作者在授权作品用于训练时,可能需要更明确的合同条款来限定用途。

值得关注的后续

第一,是否有其他数据中间商仍在提供类似的“实体书扫描服务”?目前公开信息显示,只有 ISBNdb 被曝光后退回原位,但这一类灰色供给可能转入更隐蔽的渠道。

第二,AI 公司是否会因此更加依赖已获授权的数据集、图书馆合作,或转向合成数据与开源语料?这会影响大模型训练的成本结构。

第三,监管层面是否会针对“图书扫描用于训练”出台更明确的版权规则。目前的姿态更多是事后舆论纠正,而非事前制度约束。

来源:Slashdot

celebrityanime
celebrityanime
文章: 16722

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注