华佗GPT-3提出纯强化学习域适应,HealthBench达70.1

研究者提出 OnePO 纯强化学习域适应方法,并据此训练开源医疗大模型 HuatuoGPT-3,其 27B 版本在 HealthBench 评测中报告 70.1 分。

一句话看懂:研究者提出 OnePO 纯强化学习域适应方法,并据此训练开源医疗大模型 HuatuoGPT-3,其 27B 版本在 HealthBench 评测中报告 70.1 分。

事件核心:发生了什么

2026 年 10 月 5 日,Hugging Face Papers 收录论文《HuatuoGPT-3: RL-Only Domain Adaptation from Base Models》。作者指出,传统“SFT+RL”两阶段流程虽然冷启动方便,但会降低探索多样性、增加多阶段优化复杂度,因此尝试只用强化学习做领域适应。纯 on-policy RL 存在冷启动问题,混合策略 RL 又面临两个失败模式:Gradient Starvation 和 Teacher-Distribution Anchoring。

为此,作者提出 One-stage Policy Optimization(OnePO),把教师输出当作“临时引导”:用 Adaptive Objective Evolution 加强对低概率但有信息量 token 的学习,并用 Teacher Retirement 在当前策略超越教师后丢弃教师输出。目前公开信息显示,医疗适应任务中,OnePO 仅用 2 万条训练样本,在 HealthBench(Total)上达到 67.2 分,分别高于 SFT+RL 和纯 RL 2.7 分和 7.4 分。作者进一步将其扩展到 HuatuoGPT-3 系列,其中 27B 版本在 HealthBench(Total)上报告 70.1 分,在 HealthBench Professional 上报告 71.4 分,超过 GPT-6 Astra 等前沿模型。模型和代码已在 GitHub 开源,但论文摘要不等于已上线产品,实验细节仍需查看全文。

为什么重要

这项工作的意义在于挑战了“必须先做 SFT 才能做 RL”的主流范式,为基座模型的领域适应提供了一条更简化的替代路线。如果 OnePO 的效果能在更多领域复现,开发者可能不再需要构建大规模监督微调数据,而是直接通过强化学习让基座模型向医疗、法律、金融等专业方向对齐。开源医疗大模型 HuatuoGPT-3 若真如摘要所示超过部分闭源前沿模型,也会加剧医疗 AI 领域的开源与闭源竞争,并降低医疗大模型的复现和二次开发门槛。

对用户/开发者/创作者的影响

对开发者而言,OnePO 的核心价值是降低多阶段训练流程的复杂度:少做一次 SFT,意味着更少的数据清洗、标注和调参成本。GitHub 已放出模型和代码,适合研究人员和工程团队复现、微调或迁移到其他垂直领域。对医疗 AI 应用方来说,27B 开源模型如果能在本地部署并达到接近前沿闭源模型的评测表现,会为私有化部署提供新选择。对普通用户,短期内更直接的影响可能是:未来医疗问答类 AI 工具在专业问题上的回答质量有望提升,但医疗场景仍需人类医生把关,不能把评测分数等同于临床可用性。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是 OnePO 是否会被其他团队复现,并在医疗之外的领域验证通用性;二是 HuatuoGPT-3 是否发布可用的推理 API 或量化版本,以及实际部署成本如何;三是 HealthBench 上的成绩是否能经受第三方独立评测,以及“超过 GPT-6 Astra”的结论是否在更多任务和真实场景中成立。目前公开信息仅来自论文摘要,模型卡、训练细节和评测条件尚未在素材中展开。

来源:Hugging Face Papers

celebrityanime
celebrityanime
文章: 27971

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注