VPP2 发布:先预测完整操作事件再生成动作,零样本 ALOHA 成功率提升 18.5 个百分点

机器人操作策略 VPP2 改变中间目标,让模型先预测完整操作事件的视觉未来,再据此生成动作,在真实 ALOHA 零样本任务中平均成功率达到 58.5%,比 π0.5 高出 18.5 个百分点。

一句话看懂:机器人操作策略 VPP2 改变中间目标,让模型先预测完整操作事件的视觉未来,再据此生成动作,在真实 ALOHA 零样本任务中平均成功率达到 58.5%,比 π0.5 高出 18.5 个百分点。

事件核心:发生了什么

alphaXiv 收录的论文提出 Video Prediction Policy 2(VPP2),一种世界动作模型(WAM)。作者认为现有 WAM 在开放环境中容易产生错误动作预测,原因有两个:基础视频模型没有针对操作任务优化,简单加入动作组件会削弱泛化能力。VPP2 的应对分三步:先用带详细描述的操作视频继续预训练基础视频模型,做事件级预训练;再后训练并蒸馏成固定预测视野的单步视觉规划器;最后用混合 Transformer 架构引入 0.9B 参数的动作专家,学习隐式逆动力学,输出动作块。论文报告的结果包括:在 50 对机器人图像-指令的开放任务视频预测评估中,VPP2 指令跟随成功率为 0.90,Cosmos3-64B 为 0.78;在真实 ALOHA 机器人 10 类任务零样本测试中平均成功率为 58.5%,对比 π0.5 的 40.0%。在 LIBERO-Pro、LIBERO-OOD 和 RoboDojo 基准上,经过基准特定后训练后,VPP2 取得所评估方法中最高的成功率。

为什么重要

这项工作的价值不在“又一个机器人模型”,而在它改写了动作学习的中间目标。传统策略直接学短动作块,容易对指令和初始画面学到脆弱关联;VPP2 先让机器人“想象”完整操作事件,再对齐固定时长视频块,最后映射到动作。这保留了视频基础模型的泛化能力,又用动作专家补上物理执行环节。对行业而言,它强化了“视频预测先验迁移到机器人操作”的技术路线,也说明基础视频模型的预训练数据质量、事件级标注和蒸馏策略会直接影响机器人策略的零样本表现。目前公开信息显示,这些结论来自论文实验,尚未说明是否已有可用的产品化接口或开源权重。

对用户/开发者/创作者的影响

对机器人开发者,VPP2 提供了一种可复用的策略架构思路:不必从头训练,而是把已有图像到视频大模型适配到操作数据,再通过动作专家和 LoRA 微调解锁行动能力。对关注具身智能的团队,论文中“视频模型冻结加 LoRA 适配”的做法,意味着未来可以在有限算力下复用视频生成模型的表征,降低机器人策略训练门槛。对内容创作者和产品团队,如果这类技术走向产品,视频生成模型可能不再只用于画面创作,还会成为机器人动作规划的上游组件。不过目前所有评测都限定在论文指定的任务、基准和条件内,不能理解为通用机器人能力已经解决。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

后续可以观察三点:VPP2 是否公开代码或模型权重,以验证 14B 视频模型加 0.9B 动作专家的实际推理成本和部署条件;在 ALOHA 之外的真实机器人平台和更长任务上,零样本成功率能否保持;以及事件级视频预训练、单步蒸馏这两项设计,是否会被其他 WAM 或机器人基础模型跟进采用。

来源:alphaXiv

celebrityanime
celebrityanime
文章: 28629

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注