QF3 提出过滤 Q 梯度方法,人形机器人舞蹈策略实现零样本真机迁移

QF3 用一步预测加坐标级过滤的 Q 梯度来训练流策略,首次让 off-policy 流 RL 从零学人形机器人运动并零样本上真机,训练速度比 FPO++ 快约 10 倍。

一句话看懂:QF3 用一步预测加坐标级过滤的 Q 梯度来训练流策略,首次让 off-policy 流 RL 从零学人形机器人运动并零样本上真机,训练速度比 FPO++ 快约 10 倍。

事件核心:发生了什么

2026 年 10 月 6 日,alphaXiv 上公开的论文提出 QF3(Fast Flow RL with Filtered Q-Gradients)。它是一种在线 off-policy 强化学习算法,面向流策略:用流匹配加上 critic 的动作梯度来更新策略,梯度通过流输出的一步预测反传。关键设计是过滤——只对靠近回放动作的维度施加 critic 梯度,偏离过大的坐标被裁掉,避免 critic 在没学好评估的区域乱推策略。论文称,这是首个从零训练人形运动策略并零样本迁移到硬件的 off-policy 流 RL 方法,在 Unitree G1 上训练约三分钟舞蹈动作追踪,训练用 29 自由度,部署时流积分用 5 步欧拉法。

为什么重要

流策略已是从演示学机器人行为的常用策略类,但用 RL 继续提升预训练流策略或从零学,一直受制于 off-policy 的稳定性。QF3 的价值在于给出一个可操作的“信任区域”思路:critic 只在回放动作附近发力,其余交给流匹配。消融显示,在 Humanoid-v4 上不裁剪的 Direct Q 即使把 actor 学习率降到 1/10(3×10⁻⁵ 对 3×10⁻⁴)也会导致学习崩溃,裁剪后恢复。与 on-policy 的 FPO++ 相比,在 G1 LAFAN dance1_subject2 任务上,QF3 约半小时达到满长度回合(上限 500 步),FPO++ 在挂钟时间和环境交互量上都要约 10 倍。论文还把 QF3 用于微调预训练流式操作策略,在 ABC-Sim 和 Robomimic 上做了测试。需要说明,目前公开信息仅来自论文摘要和页面素材,社区评论不等于作者结论。

对用户/开发者/创作者的影响

对做机器人 RL 的开发者,QF3 提示了一条降低训练成本的路线:复用回放缓冲、不做完整 ODE 积分、不反传整个采样器,actor 更新只需一次速度评估,更容易和已有 off-policy 训练管线结合。对关注人形机器人落地的团队,零样本真机迁移是值得跟踪的信号,但论文尚未说明鲁棒性、硬件泛化和安全边界;如果要把类似方法用于操作任务微调,ABC-Sim 和 Robomimic 上的结果只是初步验证,不能当成通用产品能力。

值得关注的后续

一是是否会出现开源实现或与主流机器人 RL 框架的集成;二是与 FPO++ 之外的其他流 RL 基线在更多任务上的对比;三是过滤半径、流时间等超参是否对不同机器人形态敏感;四是是否有人复现零样本真机迁移,以及长期运行的稳定性如何。

来源:alphaXiv

celebrityanime
celebrityanime
文章: 27842

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注