两项实验显示,与聊天机器人交谈七分钟比阅读事实清单更能削弱阴谋论信念

卡内基梅隆、MIT 和康奈尔的研究团队在两次真实突发事件后,用大模型与阴谋论信奉者进行约七分钟对话,成功削弱其信念,效果优于阅读事实清单,还能延续到数周后的新事件。

一句话看懂:卡内基梅隆、MIT 和康奈尔的研究团队在两次真实突发事件后,用大模型与阴谋论信奉者进行约七分钟对话,成功削弱其信念,效果优于阅读事实清单,还能延续到数周后的新事件。

事件核心:发生了什么

研究团队分别在 2024 年 7 月特朗普遇刺未遂事件和 2025 年 9 月查理·柯克被谋杀事件发生后的几天内,通过在线平台招募美国成年人参与实验。两次实验分别保留 472 名和 1035 名对相关阴谋论有信念的参与者。

参与者被随机分到三组:一组与谷歌 Gemini 模型对话(至少五轮,实验一使用 2024 年 2 月的 Gemini 1.5,实验二使用 2025 年 6 月的 Gemini 2.5),模型被指示通过循证对话削弱阴谋论信念;一组阅读附有引文来源的静态事实清单;第三组与模型聊“猫和狗哪个更适合做伴侣”的无关于预。两次事件均发生在所用模型的训练数据截止日期之后,研究者将经核查的事实库直接写入系统提示,区分已证实事实、已辟谣论断和明确标注为开放的问题。柯克实验中还允许联网搜索,但仅用于核实事实性陈述。

结果显示,平均约七分钟的大模型对话在两次实验中都比静态事实清单更有效地降低了参与者对自己所持阴谋论的信念,以及对“掩盖或阴谋”类陈述的认同。在特朗普事件中,由于当时官方对枪手动机尚无明确解释,对话并未提升对官方说法的信任。在柯克事件中,当局已公布嫌犯信息,对话组的信任度略高于对照组。

为什么重要

这项研究提供了大模型在信息混乱早期介入公共认知的实证数据。研究团队用已过时的 GPT-4o 筛选参与者,用不同版本的 Gemini 执行对话,说明当前主流大模型在接入可靠事实源后具备一定的说服调节能力。更重要的是,实验显示模型中存在一种“普遍性”的认知改善效果,而非仅限于某一次事件。研究者将模型回复拆解为逐句分析后发现,在证据不足时模型更多使用认知谦逊、来源批判和苏格拉底式提问,而在信息较充分时更侧重理性论证与社会危害说明。这种根据证据充分程度动态调整说服策略的行为,对研究 AI 在辟谣、心理健康干预和公共沟通中的应用方式有参考价值。论文的机构背景与跨学科视角,也使其结论在学术界具备一定权重。

对用户/开发者/创作者的影响

对内容平台和事实核查机构而言,动态、交互式的对话界面可能比静态科普文章的纠正效果更持久——实验数据显示,对话的削弱效应在两个月后仍部分可测。开发者在构建涉及敏感话题的对话应用时,可借鉴该系统提示词设计思路:把事实按“已证实/已辟谣/开放问题”分层,并让模型在证据不足时承认认知边界、以提问引导用户审视自身依据,而非强行反驳。创作者若制作辟谣内容,交互式脚本设计或比图文更高效。对使用大模型 API 的团队来说,本次实验提示了成本可控的干预窗口:仅需约七分钟对话,且模型可通过限定范围联网检索来补充新信息。企业采购或开发者选型时,模型的推理对话质量与对可信源的调用能力远比单一事实记忆更重要,因为事件发生时模型通常无相关训练数据。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一,实验表明早期干预的效果可从一次事件泛化到后续类似事件,但作者在文中也指出,对另一场发生在 Grand Blanc Township 的枪击事件,这种改善并未保持,值得观察效果迁移的边界条件。二,当前实验均在突发危机后的时间窗口内完成,未来若有团队在更长周期或不同类型议题中复用该方法,才可评估那些消退或强化效应的条件。三,学界后续对大模型说服能力的伦理边界讨论值得留意——此类技术既可能被滥用于引导信念,也可能用于大规模公共认知干预,相关规范是否落地将影响模型的部署与开放程度。

来源:The Decoder AI News

celebrityanime
celebrityanime
文章: 22021

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注