一句话看懂:alphaXiv 近日收录的论文提出 Dex-One2Many,只靠一段人类演示视频就能训练出可迁移到真实多指机械手的策略,在未见初始位姿、目标位姿和抓取方式下,成功率相比基线提升约 71%。
事件核心:发生了什么
这篇论文发布时间为 2026 年 10 月 8 日,核心是一个 real-to-sim-to-real 框架:先用视觉语言模型把人类视频抽象成有序的场景图,图中节点是手、物体和功能部件,边表示“抓取”“接触”“放入”等关系。例如扫地任务可拆成“抓刷子→接触玩具→把玩具推入簸箕”。这些图被用来约束仿真重置状态、生成稠密奖励,并允许策略从任意阶段开始训练,最终在仿真中完成训练后零样本迁移到真实机械手。
硬件测试使用 UR3 机械臂加 20 自由度 Wuji 1 手,覆盖 Doll、Can、Stamp、Hammer、Sweep 五类任务。每种方法每项任务做 30 次真实试验,其中 10 次复现视频中的初始与目标位姿,20 次使用不同位姿。结果显示,在已见配置下超过基线 6.5%,在未见场景中差距扩大到 71%。
为什么重要
灵巧手演示数据采集成本很高,而严格模仿视频动作的方法往往在起始位姿、目标位置或抓取方式变化时失效。Dex-One2Many 把视频从“动作脚本”变成“任务规格”,保留任务关系与顺序,让强化学习去探索具体动作,这为高自由度机器人操作提供了一条降低数据依赖、增强泛化的路线。对 AI 行业而言,它结合了 VLM 做任务抽象、仿真做大规模训练、真机做零样本验证,说明多模态模型与强化学习在机器人领域的协同正在从概念走向可评测的工程方案。
对用户/开发者/创作者的影响
对机器人开发者,这套思路的价值在于用现成的人类视频替代昂贵的遥操作演示,并把场景图作为 RL 训练的中间表示,便于复用到不同任务。对 AI 应用开发者,VLM 在这里承担的是结构化任务拆解,而不是直接输出动作,这种“VLM 做约束、RL 做策略”的分工值得参考。对硬件与算力侧,仿真中并行训练环境数量在消融实验里从 12,288 到 49,152 不等,说明这类方法仍然依赖可扩展的仿真算力。不过,目前公开信息仅来自论文摘要和页面素材,尚不构成已上线产品或已通过同行评审的结论。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
一是该方法能否在更多物体、更长任务链条上保持未见场景的泛化优势;二是场景图自动生成对 VLM 的依赖程度,以及 VLM 出错时策略能否纠偏;三是真实硬件适配是否只限于 Wuji 1 手和 UR3 平台,还是会走向更通用的开源或闭源方案。
来源:alphaXiv


