扫描 HuggingFace 训练数据中的 7.6 PB 数据,寻找机密信息

安全研究人员完整克隆了 HuggingFace 公共数据集中心约 7.6 PB 的训练数据,从中找到了大量真实有效、可访问敏感资源的密钥信息,这意味着许多开源模型的训练语料中正潜伏着可被实际利用的机密凭证。

一句话看懂:安全研究人员完整克隆了 HuggingFace 公共数据集中心约 7.6 PB 的训练数据,从中找到了大量真实有效、可访问敏感资源的密钥信息,这意味着许多开源模型的训练语料中正潜伏着可被实际利用的机密凭证。

事件核心:发生了什么

一项由安全研究人员发布的分析结果显示,他们对 HuggingFace 公共数据集中心做了端到端克隆,范围覆盖每一个仓库、每一个分支以及每一个大文件对象,最终扫描了约 7.6 PB 数据,目标是寻找其中可能存在的 API 密钥、令牌和数据库凭据。

研究团队强调,报告中列出的每一个密钥都向对应服务商做了验证,确认在检查时仍然有效,但团队没有使用这些密钥访问任何资源,因此实际可能造成的资金损失或数据泄露是未知数。他们称结果是一个“下限值”,不是实际损失评估。

更值得警觉的是,这些数据并非孤立或冷门资源,而是一些知名开源模型实际使用的预训练语料库。受影响的语料库有明确的文档记录,许多当前流行的开放权重模型正是建立在这些数据之上。

为什么重要

这件事把 AI 供应链安全问题推到了台前。过去行业讨论安全时,重点多在模型输出风险、隐私泄露或越狱攻击,但训练数据本身的安全状态很少被系统性地检查。HuggingFace 是目前全球最大的开源模型与数据集分发中心,几乎成了开源 AI 生态的基础设施,数据集里埋有真实密钥,意味着攻击者理论上可以顺着训练数据摸到开发者的云存储、数据库乃至第三方服务账号。

另一个层面是,大模型训练数据包含敏感凭据几乎不可避免。网络爬取的数据天然混杂各类密钥,而公开数据集每时每刻都在被复制和传播,一旦泄密,危害不是单点性的,而是随模型权重一起扩散。

此外,HN 讨论中有评论指出,这篇报告本身在排版和行文上高度依赖 Claude 生成,篇幅冗长、信息密度低,这也从侧面说明 AI 工具已经深度参与安全研究的写作流程,但质量仍需人工把控。

对用户/开发者/创作者的影响

对 AI 开发者和训练者来说,这是直接警告:任何把 API 密钥、数据库连接串或云服务令牌写进代码、配置文件、测试样本的人,只要这部分内容被收入公开数据集,就等于把钥匙挂在门外。尤其是那些构建开源预训练语料库的团队,清洗训练数据不再只是质量工程,更是安全工程的一部分。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对企业而言,如果过去只在代码仓库层面做密钥扫描,现在需要把范围扩展到 HuggingFace 数据集、模型权重以及第三方镜像上。安全团队应假设“已泄露”,尽快轮换云端密钥、启用访问审计,并检查是否存在异常调用。

对普通用户来说,直接风险不大,但间接影响正在形成:以这些语料训练出的开源模型未来可能被要求承担更强的数据安全审查义务,部分数据集可能会下架或限制访问,优质中文与多语言开源训练数据或许变得更稀缺。

值得关注的后续

首先,HuggingFace 方面是否会推出系统性的数据集密钥扫描或清理机制,还是继续依赖社区上报,这会决定整个生态的安全基线。

其次,相关开源模型团队是否会在文档中披露哪些预训练语料受波及,以及是否对已经发布的模型权重做重新评估或升级。

最后,这次曝光是否会在安全社区引发连锁反应,推动更多针对模型训练数据、数据集镜像和模型注册表的专项审计。目前公开信息显示,该项研究尚未发表完整的受影响密钥清单,后续披露范围和验证方式值得跟踪。

来源:hackernews

celebrityanime
celebrityanime
文章: 16463

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注