数学家要求 OpenAI 拿出未使用其成果的证据

继纽约大学教授质疑 OpenAI 的 Codex 可能“借用”了自己的未公开研究后,数学家 Andreas Thom 也公开要求 OpenAI 说明训练数据来源,并指责其回应“至少是不诚实的”。争议焦点是:用户与 ChatGPT 的对话,是否会进入训练数据并影响模型产出。

一句话看懂:继纽约大学教授质疑 OpenAI 的 Codex 可能“借用”了自己的未公开研究后,数学家 Andreas Thom 也公开要求 OpenAI 说明训练数据来源,并指责其回应“至少是不诚实的”。争议焦点是:用户与 ChatGPT 的对话,是否会进入训练数据并影响模型产出。

事件核心:发生了什么

据 The Verge 报道,OpenAI 上月高调公布了 10 项数学成果,其中一项涉及“非 sofic 群”(可粗略理解为无法用有限结构逼近的无限数学结构),该结果被认为大量建立在数学家 Andreas Thom 与 Gábor Kun 此前工作的基础上。数学界批评 OpenAI 未充分致谢后,公司悄然修改了相关文稿。

此前,纽约大学数学教授 Tristan Buckmaster 已公开质疑 OpenAI 模型是否从其使用 Codex 的过程中获益。Thom 随后在 Mastodon 发文称,他对 OpenAI“对我们技法的详细掌握”感到意外,因为这些路径在当时并不显然。他向 OpenAI 研究人员 Sébastien Bubeck 和 Mark Sellke 发邮件询问自己的对话是否进入训练数据或推理过程,但得到的答复只说明对话未被直接访问,未说明是否进入训练语料。Thom 表示,这种区分“至少是不诚实的”,并称只有 OpenAI 掌握判断所需的数据。

为什么重要

这不是一次普通的署名纠纷,而是触及大模型训练数据透明度的核心问题。OpenAI 在 Navier-Stokes 成果的公告中曾明确否认使用“特定用户数据”,但同时承认无法排除“去标识化数据”间接帮助模型改进。Thom 认为,去标识化只去掉姓名,去不掉数学思想的智力内容。

目前公开信息显示,研究人员几乎无法逆向推断自己的未发表成果是否被用于训练,这使“数据是否被使用”实际上只能由 OpenAI 单方面说明。对一家以闭源模型和 API 服务为核心的 AI 公司而言,这种信息不对称会影响学术界与开发者对其数据来源合规性的信任。

对用户/开发者/创作者的影响

如果你的工作涉及与 ChatGPT 或 Codex 分享未发表的研究、代码或商业构思,需要意识到:账号隐私设置与“数据是否进入训练”是两件事。企业采购和法务团队在评估 OpenAI API 或企业版时,应重点确认数据保留、去标识化与训练使用的具体条款,而不是只看“不会直接访问”这类表述。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是 OpenAI 是否会公开更具体的数据使用说明或审计机制;二是 Thom、Buckmaster 等数学家的质疑是否会引发更多学者跟进;三是监管层面是否会把“训练数据可追溯性”纳入对闭源大模型的合规要求。

来源:The Verge

celebrityanime
celebrityanime
文章: 22654

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注