据 Guardian 报道,Oxford 允许 OpenAI 用 Bodleian 藏书训练 AI 模型

据 Guardian 看到的内部文件,牛津大学允许 OpenAI 用 Bodleian 图书馆的扫描文本训练 AI 模型;双方 2025 年 3 月公开的合作只强调“扫描稀有文献”,并未说明这些扫描件会进入训练数据。

一句话看懂:据 Guardian 看到的内部文件,牛津大学允许 OpenAI 用 Bodleian 图书馆的扫描文本训练 AI 模型;双方 2025 年 3 月公开的合作只强调“扫描稀有文献”,并未说明这些扫描件会进入训练数据。

事件核心:发生了什么

2025 年 3 月,牛津大学公开与 OpenAI 的合作,当时对外说法是借助 OpenAI 的工具扫描珍贵文献,让更多学生和学者能够阅读。据 Guardian 报道,到 2025 年 6 月,Bodleian 图书馆已向 OpenAI 发送 12.5 万份旧博士论文扫描件,涵盖 19 至 20 世纪欧美高校的论文。内部会议记录显示,部分馆员担心此举损害牛津声誉,也担心 AI 的能耗问题。

牛津方面的回应是:扫描规模不大、内容已过版权保护期、且并非 OpenAI 独家使用;图书馆保留权利,并将在未来几个月把扫描件陆续上线。校方还表示,文本用于训练模型这一用途并未被隐瞒。OpenAI 方面则称,全球有超过十亿人在日常使用这类技术,训练数据反映不同文化、历史与视角很重要。牛津是 OpenAI NextGenAI 集团中唯一的英国成员,同组还有波士顿公共图书馆、加州理工、MIT 和密歇根大学等。

为什么重要

这桩合作触碰了当下大模型训练数据的一个核心矛盾:公开网络正被 AI 生成内容填满,高质量、非合成的文本越来越稀缺,AI 公司开始转向纸质书、论文库和机构档案。有的买家甚至把书拆开扫描,引发二手书商不满;404 Media 曾追踪到一批稀有书籍被送往亚马逊的扫描站点,扫描后销毁。相比之下,Bodleian 的藏书在协议下保持完整。牛津的案例说明,图书馆和高校正在成为大模型数据供应链的一环,而“数字化”和“授权训练”之间的界线,往往并不像对外声明那样清晰。

对用户/开发者/创作者的影响

对开发者和 AI 应用团队来说,这释放的信号是:高质量学术语料正在以机构合作的方式流入闭源模型,未来模型在历史、人文类问答上的表现可能提升,但这类数据通常不对外开放,开源模型难以拿到同等资源。对创作者和研究者而言,自己所在机构的数字化项目是否包含训练授权,值得留意——作品的扫描件可能被用于训练,而权利归属和使用范围取决于具体协议。目前公开信息显示,牛津保留扫描件权利并计划陆续上线,这至少给外部研究者留下了获取渠道。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是牛津承诺的未来几个月上线扫描件能否如期落地,以及上线范围是否与交给 OpenAI 的内容一致;二是馆员对声誉和能耗的顾虑会不会促使牛津调整协议条款或披露更多细节;三是 NextGenAI 其他成员是否出现类似的“扫描即训练”安排,以及监管层是否会就图书馆数据用于大模型训练提出新的合规要求。

来源:The Next Web

celebrityanime
celebrityanime
文章: 25788

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注