一句话看懂:安全公司 Truffle Security 扫描了 Hugging Face 上公开的 AI 训练数据,在 7.6 PB 数据中发现超过 22 万个仍有效的凭证,其中包括可改写代码仓库的 GitHub 令牌和能访问云数据库的密钥,意味着开源 AI 训练数据正在成为供应链攻击的入口。
事件核心:发生了什么
Truffle Security 对 Hugging Face 上所有公开数据集进行了扫描,覆盖 7.6 PB、1.87 亿个文件,这是目前已知规模最大的 AI 训练数据密钥扫描。结果显示,共有 221,303 个有效且唯一的凭证分布在 6,003 个数据集中。其中影响最严重的一组密钥可访问 393 GB 的个人身份信息,可能覆盖全球约 3.7% 的人口。
在具备写入能力的凭证中,发现 349 个 GitHub 个人访问令牌,其中 223 个拥有完整仓库写入权限,130 个可改写 CI 工作流,110 个可发布软件包;另有 318 个 Docker Hub 令牌可推送镜像。云服务方面,3,343 个 AWS 密钥通过身份验证,907 个可列出 S3 存储桶,暴露数据量下限为 185 TB,其中 51.7 TB 位于已配置阻止公共访问的存储桶中;还发现了 1,926 个可访问数据库的 Firebase 管理员密钥,以及大量仍可认证的 MongoDB 和 Postgres 连接字符串。
Truffle Security 在发布前已与 Hugging Face 沟通,后者配合处理,Hugging Face CTO Julien Chaumond 还为 TruffleHog 工具贡献了原生存储桶扫描支持。
为什么重要
这次扫描暴露了一个长期被忽视的安全盲区:开源 AI 训练数据不仅包含文本和代码,还会把开发者无意提交的密钥一并“学习”进去。任何从 Hugging Face 下载数据集进行训练或微调的个人和团队,都可能把这些有效凭证带入自己的模型和工具链。
更值得警惕的是供应链风险。某些泄露的 GitHub 令牌关联到被广泛使用的软件仓库,拥有推送代码的权限——攻击者一旦拿到这类令牌,可以向软件注入恶意代码,所有安装该软件的用户都会受影响。AI 开发工具、模型注册表、CI 流程之间的依赖关系,正在成为新的攻击面。此次扫描发现的部分令牌,就关联到拥有超过 17.8 万 GitHub Star 的 Model Context Protocol 官方组织相关账户。
对用户/开发者/创作者的影响
对普通开发者而言,如果你使用过公开数据集训练模型,或从 Hugging Face 拉取过数据集,建议立即检查自己的代码、配置文件和训练脚本中是否包含任何形式的 API 密钥、令牌或数据库连接字符串。可以使用 TruffleHog 等工具对本地仓库和历史提交做一次扫描。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
企业 AI 团队需要把密钥泄露纳入模型供应链风险评估:不仅要审查依赖的第三方模型和数据集,还要检查内部训练数据的来源。对于使用了 Firebase、AWS S3 或托管数据库的项目,应尽快轮换所有可能暴露过的凭证,并缩小权限范围。
平台层面,Hugging Face 作为开源 AI 生态的基础设施,需要建立更主动的密钥检测机制,而不是等安全公司来扫描后才响应。
值得关注的后续
首先,Truffle Security 表示后续还会发布针对存储桶扫描的专项报告,此前已发现大量新密钥,届时可以看出问题规模是否进一步扩大。
其次,Hugging Face 是否会推出面向数据集上传者的自动密钥扫描功能,值得观察。如果平台能像 GitHub 的 secret scanning 一样在上传时拦截敏感信息,将从源头降低风险。
最后,一批被披露的高权限令牌是否会被相关平台及时撤销,以及这些凭证是否已被恶意利用,目前公开信息尚未说明,需要继续跟踪。


