AI聊天机器人阅读X光片时,即使出错也自信满满,相当危险。

印度Ashoka大学CRASH Lab发布的RadLE 2.0基准测试显示,当前主流大模型在放射科诊断中普遍存在“高自信误诊”问题。测试中,人类放射科医生得分988.7分(满分2000),而最佳AI模型仅获758分,且许多模型在错误答案上表现出完全自信,这直接威胁患者安全。

AI聊天机器人阅读X光片时,即使出错也自信满满,相当危险。

一句话看懂:印度Ashoka大学CRASH Lab发布的RadLE 2.0基准测试显示,当前主流大模型在放射科诊断中普遍存在“高自信误诊”问题。测试中,人类放射科医生得分988.7分(满分2000),而最佳AI模型仅获758分,且许多模型在错误答案上表现出完全自信,这直接威胁患者安全。

事件核心:发生了什么

2026年7月19日,CRASH Lab发布了RadLE 2.0(放射科最终考试)。该测试用200个病例评估16个AI模型的诊断准确性、信心水平和自知之明(能否说“不知道”)。评分机制为:正确且高信心得满分,错误且高信心扣分,说“不知道”得零分且不扣分。结果:Anthropic的Claude Fable 5在可靠安全答案上领先,Google的Gemini 3 Pro原始准确率最高,Meta的Muse Spark 1.1最擅长判断何时该交给人类。但所有模型均不如人类。研究特别指出,Grok 4.5因更相信自己的错误答案而比前代产生更多幻觉;若模型更多选择沉默而非猜测,分数会显著提升。

为什么重要

该研究直接挑战了“AI已超越99%医生”的行业叙事。RadLE 2.0揭示了当前基准测试的核心缺陷:只奖励准确率会迫使模型猜测,而医疗场景中,自信的误诊比诚实承认不确定更危险。数据显示,开放权重模型和专用医疗模型试图回答几乎所有病例,却频繁给出中高自信的错误答案。这与现实中大量患者将X光片、MRI上传至聊天机器人的趋势形成危险对照。研究团队指责高管和投资者公开夸大AI能力,而最新研究(如4月对21个模型的评估)表明它们不具备无监督临床使用条件。

对用户/开发者/创作者的影响

对开发者:不应仅优化准确率指标,需在模型中内置不确定性量化机制,鼓励“主动拒绝回答”。开源模型在医疗场景中的风险尤其突出,需增加拒绝回答的奖励权重。对医疗创作者与平台:若构建AI辅助诊断工具,必须设置明确的“人类移交”阈值——Meta的Muse Spark 1.1架构值得参考,其通过减少幻觉和增加拒绝回答比例实现了更好的安全表现。对普通用户:目前任何通用AI聊天机器人的放射科诊断均不可信,即便是顶级闭源模型。患者应避免自行上传影像数据至聊天机器人。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

1. RadLE 2.0将滚动扩展纳入新模型,未来可追踪各模型的改进速度,尤其关注Grok、Claude Fable、Gemini系列在“自知力”上的进化。2. 研究团队计划发布包含成本分析和错误分类法的完整论文,届时可量化“高自信误诊”的实际临床成本。3. 若后续版本中,某前沿模型仍无法在安全指标上接近人类,监管机构(如FDA)可能加速出台AI诊断的披露与责任划分规则。

来源:The Decoder AI News

celebrityanime
celebrityanime
文章: 14486

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注