医生这个职业可能真的要重新定义自己的位置了。谷歌研究员干了一件狠事,他们把AI扔进了模拟的临床规培体系,不是让它背题库,而是逼它每天面对数千个难缠的虚拟病人。以前那些大语言模型最多也就是在多选题里拿高分,但那根本不叫临床医学。真正的临床是对话,是患者在描述症状时模棱两可,是你在信息不完整的情况下被迫做判断,是你得在病人说不舒服但又说不清哪里不舒服的时候稳住阵脚。 这套系统用的是在线强化学习框架,AI要连续和病人来回问答最多六十轮,中途…

谷歌研究员用在线强化学习框架训练了一个名叫 ResidencyRL 的临床推理 AI,让它连续与数千个刁钻的“虚拟病人”进行最多 60 轮诊疗对话。双盲评估显示,专家在 87.6% 的场景中更认可这个模型,红旗症状漏诊率下降 31%。这是大语言模型第一次被拉进完整临床决策流程里接受检验。

一句话看懂:谷歌研究员用在线强化学习框架训练了一个名叫 ResidencyRL 的临床推理 AI,让它连续与数千个刁钻的“虚拟病人”进行最多 60 轮诊疗对话。双盲评估显示,专家在 87.6% 的场景中更认可这个模型,红旗症状漏诊率下降 31%。这是大语言模型第一次被拉进完整临床决策流程里接受检验。

事件核心:发生了什么

据报道,谷歌研究团队没有走“刷医学题库”的老路,而是搭建了一套模拟临床规培体系。AI 被放置在一个在线强化学习框架中,连续问诊最多 60 轮,中途可调用 8 次工具,完成从患者主诉到诊断决策的完整流程。训练对象也不是“配合型病人”,而是按真实人口特征和人格特质生成的虚拟角色:高神经质患者会放大症状、低宜人性患者会质疑判断、低尽责性患者干脆不遵医嘱。

结果是硬指标改善明显:红旗症状漏诊率下降 31%,整体诊断准确率达到 88%,在高度对抗性条件下比此前提升 7 个百分点。随后研究人员安排了双盲对照评价,将 ResidencyRL 与认证的资深临床专家放在一起,专家在 87.6% 的比较中更认可 AI 模型,并在六个临床维度上全面超过基础模型。消息发布于 2026 年 8 月 12 日,原始来源为 X 平台账号 @acc_mianbei。

为什么重要

这件事的分水岭意义在于:医学 AI 的评判标准从“会不会选答案”变成了“会不会看病”。以前大语言模型在医学多项选择题里能拿高分,但临床真实场景充满信息残缺、患者表述模糊、甚至故意不配合。ResidencyRL 证明,强化学习可以让模型在“乱糟糟的现实环境”里一步步逼近正确判断。

更值得关注的是它专门针对一个临床根深蒂固的认知偏见——“过早收尾”,也就是医生找到一种可能原因后就停止深挖。AI 在这种对抗性训练里被反复校正,漏诊率下降 31% 正好对应这个软肋。对行业来说,这可能意味着医学 AI 的竞争从通用大模型比拼转向垂直临床决策能力的打磨,强化学习会成为一个重要的技术路线选项。

对用户/开发者/创作者的影响

对开发者:如果 ResidencyRL 后续通过 API 或开源模型开放,医疗问诊、病历结构化、分诊系统等应用将获得比通用模型更可靠的推理底座。但同时要注意,医疗是强监管场景,调用这类模型需要提前评估合规与责任边界。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对医院与企业:这套系统的定位更接近“医生辅助工具”而非替代品,未来可能嵌入电子病历、远程问诊和基层医疗场景,降低漏诊率。落地时需要考虑与现有 HIS 系统的集成成本,以及医生对 AI 判断的信任机制。

对普通用户:目前公开信息显示它仍是研究项目,没有直接面向患者的产品。但这类技术若成熟,最先受益的可能是医疗资源薄弱地区的分诊和初筛环节。

值得关注的后续

目前公开信息有限,有四个具体观察点值得跟踪:一是 ResidencyRL 是否会进入真实医院做临床试点,而不只是停留在模拟环境;二是谷歌是否会将这套训练框架或模型权重开源,或在 Google Cloud 上提供 API;三是医学界会不会因此重新设计评估基准,从“考试分数”转向“多轮临床决策质量”;四是 OpenAI、Anthropic 等竞争对手是否会跟进类似的对抗性强化学习路线。这个方向一旦被验证,医疗 AI 的竞赛规则可能就此改写。

来源:@acc_mianbei

celebrityanime
celebrityanime
文章: 18309

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注