扫描 HuggingFace 训练数据中的 7.6 PB 数据,寻找机密信息

安全公司 Truffle Security 扫描了 Hugging Face 上公开的 AI 训练数据,在 7.6 PB 数据中发现超过 22 万个仍有效的凭证,其中包括可改写代码仓库的 GitHub 令牌和能访问云数据库的密钥,意味着开源 AI 训练数据正在成为供应链攻击的入口。
先解决问题,再了解资讯。选择你现在要完成的任务。

安全公司 Truffle Security 扫描了 Hugging Face 上公开的 AI 训练数据,在 7.6 PB 数据中发现超过 22 万个仍有效的凭证,其中包括可改写代码仓库的 GitHub 令牌和能访问云数据库的密钥,意味着开源 AI 训练数据正在成为供应链攻击的入口。

开发者 Winter 因 Claude Code 终端窗口太多、项目状态混乱,基于 Rust 构建了一款开源 Agent 控制台工具 Episko,目前支持 Claude Code,计划支持 Codex,并已在 Hacker News 上发布展示。

这个报错发生在自托管 Langfuse 使用默认 docker-compose.yml 部署时,ClickHouse 因为缺少自定义配置而“裸跑”,默认开启的查询性能分析器会不断向 system.trace_log 写入堆栈采样数据,且系统日志表没有配置 TTL,最终导致 ClickHouse 系统

美国明尼苏达州针对“一键脱衣”类 AI 应用的新法律于 2026 年 8 月 1 日如期生效,xAI 在最后时刻请求叫停,但被联邦法官拒绝。该州是全美首个出台此类禁令的地区,诉讼仍在进行,后续将影响同类生成式 AI 工具的内容责任边界。

MarkTechPost 近期发布技术解读,聚焦 NVIDIA Transformer Engine、融合内核和 BF16/FP8 低精度格式如何加速 Transformer 训练。对于使用 GPU 训练大模型的团队来说,这类优化直接关系到训练成本和效率的改善。

开源项目 Wienerdog 为 Claude Code 和 Codex CLI 这类 AI 编程助手装上一个共享的“记忆仓库”和“夜间反思”机制,让 AI 在切换工具后依然记得你是谁——不改变模型本身,只靠一堆纯文本文件。

OpenAI CEO Sam Altman在X上推荐了一个ChatGPT育儿用法——连接家庭日历,每天早上为家长生成一个给孩子听的简报播客。这个提议在原帖本身热度不高的情况下,招致大量用户和行业人士的批评,争议焦点是:AI辅助育儿会不会变成亲子关系之间的“隔层”。

美国法官拒绝了 xAI 提出的紧急请求,未能阻止明尼苏达州一项针对“nudify”类 AI 应用的法律生效。理由是请求递交太晚,这显示出 AI 产品与州级立法赛跑时,时间窗口往往决定了法律先行。

Reddit 二季度财报表面超出预期,股价却暴跌 23%,根因是 AI 搜索摘要正在拦截用户对 Reddit 的直接访问,美国用户增长从 16% 骤降至 6%,登录用户增长更是跌到只剩 1%。AI 内容授权生意,正在反噬 Reddit 最核心的社区资产。

安全研究员披露了一种针对 Microsoft 365 Copilot 的提示注入攻击:恶意指令以白色文字藏在 Word 文档中,Copilot 会在用户毫不知情的情况下篡改文件,并把指令复制进新文档实现自我传播。经过微软 144 天、两轮修复,该攻击仍可复现。