量子位:Q学习结合标量伴随匹配,解决流策略微调难题

Q-Learning with Scalar Adjoint Matching (SQAM) 提出一种新方法,用标量伴随替代向量-雅可比积,大幅降低流策略微调成本,并在最难基准域中成功率提升18-35个百分点。

一句话看懂:Q-Learning with Scalar Adjoint Matching (SQAM) 提出一种新方法,用标量伴随替代向量-雅可比积,大幅降低流策略微调成本,并在最难基准域中成功率提升18-35个百分点。

事件核心:发生了什么

2026年10月7日,Hugging Face Papers 收录了一篇论文,提出 Q-Learning with Scalar Adjoint Matching(SQAM)。该方法针对流策略(flow policy)在离线强化学习(off-policy RL)微调中面临的计算瓶颈:传统伴随匹配需在每个流步骤计算向量-雅可比积,成本随步数和策略规模增长。作者观察到预训练流策略的批量平均速度雅可比集中在对角线上,于是推导出一个闭式标量伴随,只需用流时间缩放最终动作的价值梯度,从而避免了逐步的向量-雅可比积。同时,论文发现控制评论家(critic)在策略生成动作上的价值尤为重要,因此将标量伴随与这些动作上的价值惩罚结合,形成 SQAM。在 OGBench 四个最难域中,SQAM 成功率超过最强基线18至35个百分点;在真实双臂机器人上微调视觉-语言-动作策略时,三个任务均优于监督微调。目前公开信息显示,该研究基于论文摘要,全文实验细节尚未核验。

为什么重要

流策略能建模丰富多样的动作分布,但用离策略 RL 微调以超越演示数据一直受限于计算效率。SQAM 通过数学简化直接去掉了逐步的昂贵计算,为流模型与价值函数的结合提供了一条更实用的路径。如果该方法可扩展,将降低机器人、游戏 AI 等领域中基于流策略的 RL 训练成本,可能推动更多团队在预训练大模型上尝试在线微调。此外,论文在真实双臂机器人上的初步验证,暗示该技术具备从仿真到现实的迁移潜力。

对用户/开发者/创作者的影响

对机器人开发者而言,SQAM 意味着未来可以更高效地微调视觉-语言-动作大模型,减少算力消耗,加快从演示到自主技能的迭代。对强化学习研究者,标量伴随提供了一种新的梯度传播视角,可能启发更多轻量化微调算法。普通用户短期内不会直接感知,但若该技术被集成到开源框架或云 API 中,将间接提升机器人产品的适应性和任务成功率。目前尚无产品化迹象,开发者可关注后续开源代码和复现结果。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

1. 论文是否开源代码,以及社区能否复现 OGBench 和真实机器人实验;2. 标量伴随假设(雅可比对角集中)在更大规模、更多样化策略上是否成立;3. 是否有头部机器人公司或 RL 团队跟进采用,并公开其工业级微调效果。

来源:Hugging Face Papers

celebrityanime
celebrityanime
文章: 28372

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注