一句话看懂:机器人操作策略 VPP2 改变中间目标,让模型先预测完整操作事件的视觉未来,再据此生成动作,在真实 ALOHA 零样本任务中平均成功率达到 58.5%,比 π0.5 高出 18.5 个百分点。
事件核心:发生了什么
alphaXiv 收录的论文提出 Video Prediction Policy 2(VPP2),一种世界动作模型(WAM)。作者认为现有 WAM 在开放环境中容易产生错误动作预测,原因有两个:基础视频模型没有针对操作任务优化,简单加入动作组件会削弱泛化能力。VPP2 的应对分三步:先用带详细描述的操作视频继续预训练基础视频模型,做事件级预训练;再后训练并蒸馏成固定预测视野的单步视觉规划器;最后用混合 Transformer 架构引入 0.9B 参数的动作专家,学习隐式逆动力学,输出动作块。论文报告的结果包括:在 50 对机器人图像-指令的开放任务视频预测评估中,VPP2 指令跟随成功率为 0.90,Cosmos3-64B 为 0.78;在真实 ALOHA 机器人 10 类任务零样本测试中平均成功率为 58.5%,对比 π0.5 的 40.0%。在 LIBERO-Pro、LIBERO-OOD 和 RoboDojo 基准上,经过基准特定后训练后,VPP2 取得所评估方法中最高的成功率。
为什么重要
这项工作的价值不在“又一个机器人模型”,而在它改写了动作学习的中间目标。传统策略直接学短动作块,容易对指令和初始画面学到脆弱关联;VPP2 先让机器人“想象”完整操作事件,再对齐固定时长视频块,最后映射到动作。这保留了视频基础模型的泛化能力,又用动作专家补上物理执行环节。对行业而言,它强化了“视频预测先验迁移到机器人操作”的技术路线,也说明基础视频模型的预训练数据质量、事件级标注和蒸馏策略会直接影响机器人策略的零样本表现。目前公开信息显示,这些结论来自论文实验,尚未说明是否已有可用的产品化接口或开源权重。
对用户/开发者/创作者的影响
对机器人开发者,VPP2 提供了一种可复用的策略架构思路:不必从头训练,而是把已有图像到视频大模型适配到操作数据,再通过动作专家和 LoRA 微调解锁行动能力。对关注具身智能的团队,论文中“视频模型冻结加 LoRA 适配”的做法,意味着未来可以在有限算力下复用视频生成模型的表征,降低机器人策略训练门槛。对内容创作者和产品团队,如果这类技术走向产品,视频生成模型可能不再只用于画面创作,还会成为机器人动作规划的上游组件。不过目前所有评测都限定在论文指定的任务、基准和条件内,不能理解为通用机器人能力已经解决。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
后续可以观察三点:VPP2 是否公开代码或模型权重,以验证 14B 视频模型加 0.9B 动作专家的实际推理成本和部署条件;在 ALOHA 之外的真实机器人平台和更长任务上,零样本成功率能否保持;以及事件级视频预训练、单步蒸馏这两项设计,是否会被其他 WAM 或机器人基础模型跟进采用。
来源:alphaXiv


