一句话看懂:一名开发者抓取了艺术家社区 Cara 上约 1200 万张公开作品用于 AI 训练,事后不仅删除数据,还与 Cara 创始人合作开发开源防护工具。这起“先攻击、后合作”的事件,暴露了 AI 训练数据获取的灰色地带,也推动创作者从被动抗议转向主动防御。
事件核心:发生了什么
从 8 月 13 日起,图像分享平台 Cara 在十天内遭遇三次大规模数据抓取。第一起由一位 Reddit 用户发起,他以不到 10 美元的成本抓取了约 1200 万张公开图片,组成 12TB 数据集,并在 r/DefendingAIArt 板块炫耀。该帖很快被删除,但已引发 AI 社区和创作者之间的激烈争论。
随后两周内,至少两名模仿者跟进:一人抓取约 850 万条链接及用户元数据并上传至 Hugging Face,平台最终仅移除个人元数据,因 URL 指向的是艺术家自行公开展示的作品,版权投诉无法适用;另一人抓取 12.3 万张图片及含个人信息的用户简介,发布在 Academic Torrents 上。为此,Cara 创始人、摄影师张晶娜发起众筹,目标 12 万美元用于法律维权,目前已筹集逾 10 万美元。
转折在于,首位抓取者主动删除数据集,与张晶娜取得联系,并同意共同开发一个开源工具,帮助艺术家识别和阻止类似抓取行为。张晶娜表示,Cara 已加强登录验证等临时措施,但无法彻底阻止抓取。
为什么重要
这起事件将 AI 训练数据合规争议从抽象讨论推入真实攻击场景。抓取公开内容训练大模型在技术上成本极低,法律上却处于模糊地带——Cara 已过滤 AI 生成图像并提供基础保护,但仍无法防止直接抓取,说明当前以“用户授权”为核心的平台保护机制,在批量爬虫面前几乎无效。
更深层的问题在于:Hugging Face 的回应表明,当 URL 指向艺术家自行发布的公开内容时,平台方无需承担删除义务。这意味着在现行法律框架下,抓取公开 URL 本身并不构成侵权,真正的争议点仍是训练行为本身。若最终判例确立“公开即授权”逻辑,数以百万计创作者的权益保护将面临根本性挑战。
对用户/开发者/创作者的影响
对创作者而言,Cara 的经历说明:任何公开上传的作品都可能被无差别抓取,更换平台并不能规避风险——大型平台反而因数据量更大而成为更频繁的抓取目标。张晶娜提醒用户,删除作品离开 Cara 并不会让作品更安全。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
对开发者和 AI 从业者而言,这起事件敲响合规警钟:Hugging Face 对元数据与 URL 的区别处理,以及 Cara 基于《数字千年版权法》的投诉路径,都提示数据获取方需要更谨慎地评估训练数据的来源和合法性,避免将个人隐私信息纳入数据集。
对开源社区而言,抓取者与受害方合作开发防护工具是一种新尝试,但开源工具本身如何防止被用于更大规模的抓取,仍是未知数。
值得关注的后续
第一,Cara 开源防护工具的具体形态和发布时间尚未公布,值得关注它能否真正阻挡批量抓取,以及是否会被其他中小型创作者平台采纳。
第二,张晶娜参与的针对 Stability AI、Midjourney、Google 的两起集体诉讼仍在进行,Cara 是否会将本次抓取事件纳入诉讼证据,将影响 AI 图像生成公司对训练数据合规的既有判断。
第三,Hugging Face 在元数据与 URL 之间的立场,可能成为 AI 开发者平台处理类似投诉的参考模板,后续是否会有新的监管指引或平台政策跟进,需要持续观察。
来源:Wired AI


