一句话看懂:一起新诉讼指控 xAI 在训练 Grok 图像生成模型时使用了儿童性虐待材料(CSAM),原告还认为 Grok 生成的违规图像可能被再次用于模型训练。这是首个直接指控 xAI 用 CSAM 训练模型的案件,将 AI 训练数据合规问题推到公众面前。
事件核心:发生了什么
8月中旬,一位化名 Jane Doe 的原告向法院提交诉状,指控 xAI 在构建 Grok 的图像和视频生成能力时,使用了包含她童年被虐待影像的数据集。原告称,这些图像已由美国国家失踪与受虐儿童中心(NCMEC)列入 CSAM 哈希列表,但“同一材料”据称出现在 xAI 的训练数据中。
诉状进一步指出,根据 Grok 的服务条款,公开的 X 平台帖子和 Grok 自身的输出默认都被视为训练数据。这意味着用户公开分享的图片不只被他人看到,还会直接进入 xAI 的训练流程。原告特别提到,xAI 的条款并未明确将 CSAM、非自愿亲密影像(NCII)或 NSFW 内容列为排除类别,因此模型生成的有害图像可能继续回流训练。
原告还提出,由于从已训练模型中完全移除某个训练样本的影响在技术上非常困难,且 xAI 未公开声称做过此类清理,任何在删除前被纳入训练的 CSAM 都可能在原图下架后继续影响模型输出。诉讼要求 xAI 销毁服务器上存储的 Grok 生成 CSAM,并阻止 Grok 未来生成任何性化输出。
为什么重要
这是首例将 xAI 与 CSAM 训练数据直接关联的诉讼。此前研究者曾发现某个大型公开数据集中存在 CSAM,但当时没有证据表明 xAI 使用了该数据集。此次诉讼的独特之处在于,它同时挑战了 AI 公司常用的“公开数据即可用于训练”的逻辑,并直指模型输出再训练(recursive training)可能带来的法律风险。
对 AI 行业而言,该案的核心问题在于:当基础模型经过大规模互联网数据训练后,开发者是否有义务彻底排查并清除其中的非法内容?目前行业普遍依赖哈希匹配和关键词过滤来降低风险,但这类方法对已训练进模型参数中的“隐性记忆”几乎无效。如果法院采纳原告关于“训练影响无法清除”的论证,将可能改变大模型训练和部署的合规标准,影响所有从事文生图、文生视频模型开发的团队。
对用户/开发者/创作者的影响
对普通用户而言,这一案件提醒人们:公开发布在社交平台上的图片,包括个人照片,可能成为 AI 模型训练数据的一部分,而用户对此几乎没有控制权。对开发者和企业来说,若最终判决认定 xAI 需对训练数据中的非法内容承担责任,那么使用互联网抓取数据训练模型的团队将面临更高的合规审查压力。依赖开源数据集或第三方数据服务的团队,也需要更加严格地核查数据来源和内容纯净度。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
内容创作者则应警惕:在 X 平台发布图片或使用 Grok 生成图像时,这些内容默认进入训练流程。即便平台后来删除了违规内容,模型内部的“记忆”仍可能保留其对输出的影响,这在实际操作中几乎无法由用户自行纠正。
值得关注的后续
第一,法院是否会批准集体诉讼资格,以及 xAI 是否会公开其训练数据的具体来源和过滤机制。第二,这次诉讼是否会促使更多 AI 公司明确公布训练数据中 NSFW 内容的处理政策,尤其是将 CSAM 列为独立排除类别。第三,美国立法机构是否会加速推进针对 AI 训练数据的溯源和问责机制,例如强制要求模型训练数据包含合规声明或进行第三方审计。


