扫描 HuggingFace 训练数据中的 7.6 PB 数据,寻找机密信息

安全研究人员完整克隆了 HuggingFace 公共数据集中心约 7.6 PB 的训练数据,从中找到了大量真实有效、可访问敏感资源的密钥信息,这意味着许多开源模型的训练语料中正潜伏着可被实际利用的机密凭证。

安全研究人员完整克隆了 HuggingFace 公共数据集中心约 7.6 PB 的训练数据,从中找到了大量真实有效、可访问敏感资源的密钥信息,这意味着许多开源模型的训练语料中正潜伏着可被实际利用的机密凭证。

一家名为 Autonomous 的硬件公司推出了一款 9 美元的 NFC 物理钥匙,必须用手机扫描才能解锁被屏蔽的成瘾应用,把“靠意志力”的屏幕时间管理变成了“靠物理距离”的硬约束。

安全公司 Truffle Security 扫描了 Hugging Face 上公开的 AI 训练数据,在 7.6 PB 数据中发现超过 22 万个仍有效的凭证,其中包括可改写代码仓库的 GitHub 令牌和能访问云数据库的密钥,意味着开源 AI 训练数据正在成为供应链攻击的入口。

开发者 Winter 因 Claude Code 终端窗口太多、项目状态混乱,基于 Rust 构建了一款开源 Agent 控制台工具 Episko,目前支持 Claude Code,计划支持 Codex,并已在 Hacker News 上发布展示。

美国明尼苏达州针对“一键脱衣”类 AI 应用的新法律于 2026 年 8 月 1 日如期生效,xAI 在最后时刻请求叫停,但被联邦法官拒绝。该州是全美首个出台此类禁令的地区,诉讼仍在进行,后续将影响同类生成式 AI 工具的内容责任边界。

MarkTechPost 近期发布技术解读,聚焦 NVIDIA Transformer Engine、融合内核和 BF16/FP8 低精度格式如何加速 Transformer 训练。对于使用 GPU 训练大模型的团队来说,这类优化直接关系到训练成本和效率的改善。

开源项目 Wienerdog 为 Claude Code 和 Codex CLI 这类 AI 编程助手装上一个共享的“记忆仓库”和“夜间反思”机制,让 AI 在切换工具后依然记得你是谁——不改变模型本身,只靠一堆纯文本文件。

OpenAI CEO Sam Altman在X上推荐了一个ChatGPT育儿用法——连接家庭日历,每天早上为家长生成一个给孩子听的简报播客。这个提议在原帖本身热度不高的情况下,招致大量用户和行业人士的批评,争议焦点是:AI辅助育儿会不会变成亲子关系之间的“隔层”。

美国法官拒绝了 xAI 提出的紧急请求,未能阻止明尼苏达州一项针对“nudify”类 AI 应用的法律生效。理由是请求递交太晚,这显示出 AI 产品与州级立法赛跑时,时间窗口往往决定了法律先行。

Reddit 二季度财报表面超出预期,股价却暴跌 23%,根因是 AI 搜索摘要正在拦截用户对 Reddit 的直接访问,美国用户增长从 16% 骤降至 6%,登录用户增长更是跌到只剩 1%。AI 内容授权生意,正在反噬 Reddit 最核心的社区资产。