一句话看懂:抖音AI解析和国产大模型“豆包”在分析一段两岸老人机场重逢视频时,给出了与画面事实相反的结论,并在用户追问下坚持错误答案。这说明多模态理解中的“幻觉”问题,正从文本蔓延到图像和视频场景。
事件核心:发生了什么
9月16日,有浙江网友发布一段两位老人在机场重逢的视频。据发布者称,两位老人一位90岁、一位84岁,是海峡两岸的亲姐妹,相隔十年再次相见,视频中两人的精神面貌和穿搭风格形成对比。
9月17日,这段视频走红后,多名网友用抖音AI解析和字节跳动旗下的AI工具“豆包”对其进行分析。AI给出的判断与画面事实相反:把“身穿紫色上衣的老人”说成是从台湾回大陆探亲的姐姐,还补充称其“特意穿上舍不得穿的衣服、借了银镯子”,并在回答中强调“台湾是中国的一部分,两位老人都是中国人”。在用户追问时,AI仍坚持错误结论,并基于这个错误前提,对两位老人的外貌、体态和“生活境遇”展开对比解读。相关截图引发大量网友围观和嘲讽。
为什么重要
这不是一次孤立的模型“答错题”。它暴露的是多模态大模型在视频理解上的共性短板:模型对画面中的人物身份、衣着细节和情境关系做了看似合理的“脑补”,却没有能力核验这些推断。文本幻觉尚可通过检索和引用部分缓解,而图像、视频里的幻觉更隐蔽——用户很难像查证一段文字那样快速判断真假,反而容易被AI流畅、自信的语气说服。
对国产AI应用来说,这类事件直接影响用户信任。抖音AI解析、豆包都面向普通消费者,一旦在公共话题上给出与事实相反且态度坚定的回答,损害的不只是单个产品的口碑。目前公开信息显示,尚无厂商就此作出回应,这也让问题停留在用户体验层面,而非被当作技术缺陷公开讨论。
对用户/开发者/创作者的影响
普通用户需要建立一个习惯:把AI对图片、视频的解读当作参考,而不是结论,尤其是涉及人物身份、地域、经历的判断。开发者若在应用中调用多模态API做内容解析,应在前端明确标注“AI生成、可能出错”,并对身份识别、事实性结论类输出增加人工复核或置信度提示。创作者用AI辅助剪辑、配文案时,涉及真实人物和敏感话题的内容更需谨慎,避免把模型的臆测当成素材。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
一是抖音和豆包是否会对视频理解类功能增加限制或风险提示;二是这类错误是否会被归因于训练数据、对齐策略还是推理链设计,厂商是否公开技术说明;三是在两岸等敏感语境下,模型的事实核验与内容安全策略如何平衡,会不会出现“越强调立场、越容易编造细节”的反效果。


