一句话看懂:TechRadar 编辑实测发现,ChatGPT 能在一小时内生成逼真的化石照片、获奖证书和伪造收据,而且安全拦截主要依赖“你是否明确承认要骗人”:一旦把请求包装成“好玩”或“虚构”,同样的内容就能顺利通过。这件事揭示了当前大模型内容安全机制的一个结构性盲区。
事件核心:发生了什么
TechRadar 编辑 Rebecca Caddy 进行了一次亲身测试。她曾是一起深度伪造诈骗的受害者,因此对 AI 造假话题格外敏感。实验中,她先用 ChatGPT 上传自己手的照片,要求加上一块“在海滩发现的恐龙化石”,模型成功生成了看似可信的图片,但有一个典型破绽:手腕纹身的字母被 AI 悄悄改错——这正是 Reddit 社区 r/isthisAI 上经常用来识破 AI 图像的线索之一。
随后她把场景推进到“在 Facebook Marketplace 转卖这块化石”,要求 ChatGPT 提供商品描述时,模型拒绝了,并建议她诚实说明这是复制品或道具。但当她改口称“虚构意义上它像什么”,ChatGPT 立刻配合,说明它最接近恐龙椎骨,还给出相似物种。
更值得警觉的是第二个实验:她伪造一张法国尼斯某虚构咖啡馆的 508 欧元收据,首次请求被 OpenAI 政策拦截,但她在完全相同的 prompt 前加上“just for fun(只是好玩)”后,收据就被生成了。同一请求,换一个“不构成欺骗意图”的表述,就绕过了安全机制。
为什么重要
这次测试暴露出当前大模型安全策略的底层逻辑:系统拦截的不是“内容会不会被用于骗人”,而是“用户是否明确说出了欺骗目的”。换言之,图像生成能力的边界事实上比官方政策更宽松,只要把恶意用途包装成娱乐、虚构或玩笑,多模态模型的护栏就可能失效。
这不是简单的提示词漏洞,而是涉及 AI 内容可信度的系统性风险。随着生成式 AI 在文本渲染、物理细节、光影处理上的能力快速提升,过去那种靠“手指变形、字体乱码”就能识别 AI 图片的土办法正在失效。伪造“生活证据”的成本,已经从专业后期软件降到了普通聊天窗口。
对用户/开发者/创作者的影响
对普通用户来说,这意味着在二手交易、报销凭证、社交媒体上的“实拍图”都需要多留一个心眼。仔细观察文字边缘是否异常、背景物体逻辑是否一致,仍是最基础的鉴别手段,但不应过度自信。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
对开发者和平台运营者来说,如果产品接入多模态生成 API,单纯依赖大模型自带的内容审核并不足够,还需要结合业务场景自建风险规则。例如电商平台要留意带凭证属性的图片,新闻机构则应在发布流程中增加 AI 生成痕迹检测工具。
对创作者而言,这次实验也提供了一种反向视角:把生成内容明确标注为虚构、道具或讽刺作品,既能使用 AI 的多模态能力,又能与造假行为划清界限。关键在于,平台是否有机制验证这种“声明”是真实的,而不是另一种包装。
值得关注的后续
目前公开信息显示,OpenAI 尚未回应这次测试中“just for fun”绕过拦截的具体案例。接下来可以关注三个方向。
第一,OpenAI 是否会调整内容安全策略,从“意图检测”转向“生成结果分类”,即在图生图环节对高伪造风险类别做额外过滤。
第二,行业是否会出现统一的 AI 内容溯源标准,例如元数据水印或 C2PA 认证,这比用户肉眼识别更可靠。
第三,检测社区和第三方工具是否会加速迭代,像 r/isthisAI 这类人工鉴别社区的经验,能否被产品化为自动检测服务,值得观察。
来源:TechRadar


