RLHND:用视频基础模型做手部追踪,为机器人学习补上触觉

一篇新论文提出 RLHND,把预训练视频扩散模型改造成手部追踪器,在估计手部姿态的同时预测接触与受力信息,目标是让人手视频更可用地训练机器人策略。

一句话看懂:一篇新论文提出 RLHND,把预训练视频扩散模型改造成手部追踪器,在估计手部姿态的同时预测接触与受力信息,目标是让人手视频更可用地训练机器人策略。

事件核心:发生了什么

2026 年 10 月 7 日,Hugging Face Papers 收录了一篇题为 RLHND 的论文。作者指出现有手部追踪器多从裁剪画面直接回归姿态,对手部运动和物体交互的先验有限,导致估计结果不够准确,也可能出现物理上不一致的情况;缺少接触和力等物理线索,也限制了人类视频在机器人策略训练中的使用。

RLHND 的做法是把预训练的 Cosmos 3 视频扩散骨干,通过 clean-latent conditioning 变成确定性的片段级特征提取器,把学到的运动与手物交互先验带入追踪任务。姿态部分输出符合解剖结构的关节角度,并可选地约束手形参数,使同一视频甚至同一演员的多段视频中手形保持一致。触觉部分是一条独立专家分支,在冻结姿态分支的条件下训练,用于预测手表面的密集接触与受力。摘要称,该方法在多个姿态估计基准以及接触、受力估计任务上取得当前最优表现,并展示了重定向结果和真实机器人实验。论文表示代码将公开在项目页面。

为什么重要

机器人学习近来越来越倚重人类视频数据,但视频本身没有力反馈和接触标签,姿态估计的抖动也会被策略放大。RLHND 的价值在于把两类信息放进同一个框架:视频基础模型提供先验,触觉分支补齐物理信号。这对“用人类视频教机器人”的路线是一个直接补强,也说明视频生成模型的骨干正在被复用为感知模型,而不只是生成内容。若代码和方法可复现,可能成为人视频与机器人策略之间的一条中间层工具。目前公开信息仅为论文摘要,实验条件和数据集细节尚未核验。

对用户/开发者/创作者的影响

对机器人研究者,RLHND 提供的是一个可参考的架构思路:用预训练视频扩散模型做特征提取,再挂接专用分支做接触与力估计。对从事动作捕捉、手语或 VR/AR 交互的开发者,手形一致性和解剖合理的关节角意味着更稳定的重定向输入,但需注意它目前是研究模型,不是可直接调用的 API 或产品。对内容创作者,人体视频数据未来可能有新的使用场景,但涉及肖像和行为数据时仍需关注授权与合规。算力方面,视频扩散骨干的推理成本不低,落地时需要在精度和实时性之间权衡。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是代码是否按期开源,以及是否提供可复现的预训练权重;二是真实机器人实验的任务类型、成功率和数据规模是否公开;三是触觉预测能否泛化到不同手形、不同拍摄设备和不同视角,而不是仅限单目第一视角视频。

来源:Hugging Face Papers

celebrityanime
celebrityanime
文章: 28107

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注