自信心暴涨但正确率暴跌?最新研究揭示AI辅助下的人类决策悖论

一项涉及 3132 名参与者、共五组实验的研究发现,接入 GPT-5.5、Claude 4.6 Sonnet、Gemini 3.5 Flash 等大模型后,人们回答问题的信心大幅上升,但正确率反而暴跌,并且越来越不愿意说“我不知道”。

一句话看懂:一项涉及 3132 名参与者、共五组实验的研究发现,接入 GPT-5.5、Claude 4.6 Sonnet、Gemini 3.5 Flash 等大模型后,人们回答问题的信心大幅上升,但正确率反而暴跌,并且越来越不愿意说“我不知道”。

事件核心:发生了什么

据 AIbase 报道,这项研究让受试者回答一批高度冷门、容易触发模型幻觉的问题。在没有 AI 辅助的对照组中,参与者对 36% 至 44% 的题目选择不作答;但在拿到 AI 建议后,弃答比例骤降到 3% 至 6%。

更值得注意的是信心与准确率的背离:受试者的答题信心从 29.6 分(满分 100)升至 75.9 分,实际正确率却从 27.5% 降到 9.2%。这意味着即便模型(例如 Step3.5 Flash)给出错误建议,人们也倾向于照单全收,并产生过度自信。

研究还测试了经济激励:答对给奖励、答错扣分,能一定程度减少人们求助 AI 的频率,但没有真正扭转这种错位的信任。当实验模拟搜索引擎和写作助手的常见做法——自动把 AI 生成的答案推到用户面前——即使有经济激励,选择暂缓判断的比例也从 39% 降到 7%。

为什么重要

过去行业关注的重点是模型能力,比如推理、训练成本和参数规模;这项研究把问题挪到了人机交互层面。当大模型的流畅表达成为一种“默认答案”,人类原有的怀疑和自省习惯会被削弱,认知任务被过度外包。

这对 AI 应用的落地方式提出了新要求。无论是搜索、写作助手还是企业知识库,答案的呈现方式、置信度提示和交互节奏,都可能直接影响使用者的判断质量。结合微软及相关学术机构此前关于 AI 影响批判性思维的结论,模型准确率之外,如何设计“让人保留判断”的产品机制,会是下一阶段的重要议题。

对用户/开发者/创作者的影响

对普通用户来说,AI 给出的答案越自然,越需要主动区分“我知道”和“它说得顺”。尤其面对冷门事实、数据和引用,保留一点不确定感反而更安全。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对开发者和产品团队而言,把模型输出直接前置、不给用户停顿和核验空间,短期看体验流畅,长期可能放大误判风险。在 API 和 AI 应用设计里加入置信度标记、来源提示、二次确认,或对高风险问题默认要求用户复核,都是值得考虑的方向。

对内容创作者来说,用大模型辅助选题、写稿和查资料已成常态,但这项研究提醒:流畅不等于正确。涉及事实核查的部分,仍需要有独立验证流程。

值得关注的后续

一是这类实验结论能否在更真实的产品场景中被复现,例如搜索、办公助手和写作工具。二是模型厂商和平台是否会跟进调整交互设计,比如默认不直接给结论、增加不确定性提示。三是监管与企业采购层面,是否会把“防止过度依赖”纳入 AI 应用的评估标准。

来源:AIbase

celebrityanime
celebrityanime
文章: 25993

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注