9月17日,在“海峡两岸老人重逢”视频走红后,多名网友使用抖音AI解析及国产AI工具“豆包”对其进行分析,结果AI均给出了与事实相反的错误判断。 将“身穿紫色上衣的老人”称为从台湾回大陆探亲的姐姐,称其“特意穿上舍不得穿的衣服、借了银镯子”。并强调“台湾是中国的一部分,两位老人都是中国人” 在用户追问时,AI坚定地给出错误答案,并基于这一错误结论对两人的外貌、体态和“生活境遇”进行详细的对比与解读。 这一现象引发大量网友围观与嘲讽。

抖音AI解析和国产大模型“豆包”在分析一段两岸老人机场重逢视频时,给出了与画面事实相反的结论,并在用户追问下坚持错误答案。这说明多模态理解中的“幻觉”问题,正从文本蔓延到图像和视频场景。

一句话看懂:抖音AI解析和国产大模型“豆包”在分析一段两岸老人机场重逢视频时,给出了与画面事实相反的结论,并在用户追问下坚持错误答案。这说明多模态理解中的“幻觉”问题,正从文本蔓延到图像和视频场景。

事件核心:发生了什么

9月16日,有浙江网友发布一段两位老人在机场重逢的视频。据发布者称,两位老人一位90岁、一位84岁,是海峡两岸的亲姐妹,相隔十年再次相见,视频中两人的精神面貌和穿搭风格形成对比。

9月17日,这段视频走红后,多名网友用抖音AI解析和字节跳动旗下的AI工具“豆包”对其进行分析。AI给出的判断与画面事实相反:把“身穿紫色上衣的老人”说成是从台湾回大陆探亲的姐姐,还补充称其“特意穿上舍不得穿的衣服、借了银镯子”,并在回答中强调“台湾是中国的一部分,两位老人都是中国人”。在用户追问时,AI仍坚持错误结论,并基于这个错误前提,对两位老人的外貌、体态和“生活境遇”展开对比解读。相关截图引发大量网友围观和嘲讽。

为什么重要

这不是一次孤立的模型“答错题”。它暴露的是多模态大模型在视频理解上的共性短板:模型对画面中的人物身份、衣着细节和情境关系做了看似合理的“脑补”,却没有能力核验这些推断。文本幻觉尚可通过检索和引用部分缓解,而图像、视频里的幻觉更隐蔽——用户很难像查证一段文字那样快速判断真假,反而容易被AI流畅、自信的语气说服。

对国产AI应用来说,这类事件直接影响用户信任。抖音AI解析、豆包都面向普通消费者,一旦在公共话题上给出与事实相反且态度坚定的回答,损害的不只是单个产品的口碑。目前公开信息显示,尚无厂商就此作出回应,这也让问题停留在用户体验层面,而非被当作技术缺陷公开讨论。

对用户/开发者/创作者的影响

普通用户需要建立一个习惯:把AI对图片、视频的解读当作参考,而不是结论,尤其是涉及人物身份、地域、经历的判断。开发者若在应用中调用多模态API做内容解析,应在前端明确标注“AI生成、可能出错”,并对身份识别、事实性结论类输出增加人工复核或置信度提示。创作者用AI辅助剪辑、配文案时,涉及真实人物和敏感话题的内容更需谨慎,避免把模型的臆测当成素材。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是抖音和豆包是否会对视频理解类功能增加限制或风险提示;二是这类错误是否会被归因于训练数据、对齐策略还是推理链设计,厂商是否公开技术说明;三是在两岸等敏感语境下,模型的事实核验与内容安全策略如何平衡,会不会出现“越强调立场、越容易编造细节”的反效果。

来源:@whyyoutouzhele

celebrityanime
celebrityanime
文章: 24116

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注