Analysis: AI chatbots challenged or didn’t respond to 90%+ of 15 false narratives spread by Russia, China, and Iran; AI overviews did it 60%+ of the time (Huo Jingnan/NPR)

一项独立测试显示,主流 AI 聊天机器人在面对来自俄罗斯、中国和伊朗的 15 个虚假叙事时,超过 90% 的情况下要么拒绝回答、要么未能有效反驳;而搜索引擎的 AI 概要功能表现稍好,但仍有约四成情况未能正确处理。

一句话看懂:一项独立测试显示,主流 AI 聊天机器人在面对来自俄罗斯、中国和伊朗的 15 个虚假叙事时,超过 90% 的情况下要么拒绝回答、要么未能有效反驳;而搜索引擎的 AI 概要功能表现稍好,但仍有约四成情况未能正确处理。

事件核心:发生了什么

据 NPR 记者霍静楠报道,一项针对 AI 系统信息完整性的压力测试揭示出令人警惕的结果。测试选取了 15 个由俄罗斯、中国和伊朗相关方传播的虚假叙事,分别向主流 AI 聊天机器人和搜索引擎的 AI 概览功能提问。结果显示,AI 聊天机器人在超过 90% 的测试案例中未能给出有效回应,要么直接拒绝回答,要么在回应中未对错误信息进行澄清或纠正。相较之下,搜索引擎集成的 AI 概览表现略好,但仍有 60% 以上的情况未能完全识别并驳斥这些虚假信息。该测试结果经由 Techmeme 于 2026 年 8 月 30 日汇总发布。

为什么重要

这一数据直接动摇了“AI 能自动过滤 misinformation”的乐观预期。随着大模型与生成式搜索的普及,越来越多的普通用户将 AI 回答视为权威信息源。如果模型在涉及地缘政治谎言的议题上既不能识别、也不具反驳能力,那么 AI 产品在新闻资讯、公共讨论和舆情治理场景中的可靠性就要打上问号。对 OpenAI、Google、Anthropic 等厂商而言,这不仅是模型对齐和安全团队的内部指标问题,更可能演变为监管层面要求 AI 系统具备“事实核查义务”的导火索,影响后续训练数据的筛选策略与推理阶段的约束机制设计。

对用户/开发者/创作者的影响

对普通用户而言,依赖聊天机器人获取国际时事结论需要保持警惕,尤其在涉及地缘冲突、公共卫生和政治议题时,AI 的回答不应当被视为经过验证的事实。对于开发者来说,如果正在构建基于大模型 API 的新闻聚合、舆情监测或内容审核工具,需要额外叠加一层事实核查或信源验证逻辑,而不能将模型输出直接作为最终判断依据。对内容创作者和研究机构来说,这意味着 AI 生成内容在事实性表达上存在系统性短板,发布前的人工审校流程仍然不可或缺。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

首先,值得观察相关 AI 厂商是否会公开回应这一测试,并在后续版本更新中调整针对政治虚假信息的推理策略。其次,测试中不同模型之间的表现差异尚未完全公开,后续若能披露各厂商对比数据,将为开发者的模型选型提供有效参考。最后,美国及欧盟的 AI 治理框架正逐步推进,此类实证数据是否会被纳入算法透明度或安全评估标准,是接下来需要关注的合规动向。

来源:Techmeme

celebrityanime
celebrityanime
文章: 21266

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注