斯坦福开源OpenWAM框架:让世界-动作模型可配置、可比较

斯坦福团队开源 OpenWAM,把视频预测与机器人动作生成解耦成可配置的四种交互方式,并验证了反事实数据对动力学学习的提升。

一句话看懂:斯坦福团队开源 OpenWAM,把视频预测与机器人动作生成解耦成可配置的四种交互方式,并验证了反事实数据对动力学学习的提升。

事件核心:发生了什么

2026 年 10 月 6 日,斯坦福大学研究团队在 alphaXiv 发布论文《OpenWAM: An Open Framework for Composable World-Action Models》,提出一个开源的世界-动作模型框架。当前多数世界-动作模型(WAM)同时调整视频骨干、交互结构、监督方式和推理流程,设计选择难以比较。OpenWAM 基于 Wan2.2-5B 视频模型,先在超过 10,000 小时机器人视频上做因果预训练,再通过共享 Mixture-of-Transformers 架构接入一个动作专家,支持联合生成、先视频后动作、先动作后视频、解耦生成四种模式。

在 LIBERO 四个测试套件和真实双臂任务上,OpenWAM 报告了较高成功率。其中因果适配的机器人视频训练将 LIBERO-Long 上 VTA 模式成功率从 68.4% 提升至 97.8%。此外,仅适配视频预测器时,一个在反事实数据与演示上训练的冻结局部上下文逆动力学模型,在四个留出的 LIBERO-90 任务上达到 84.0% 平均成功率,而全上下文逆模型为 47.0%,仅用演示训练的局部模型为 21.5%。前向动力学方面,反事实监督使 RGB 预测误差降低 34.5%,并将同状态 16 种结果的识别率从 21.1% 提升到 71.3%。

为什么重要

世界-动作模型长期缺乏统一比较基准,不同团队各自改动视频骨干、交互方式和推理流程,导致难以判断哪项设计真正有效。OpenWAM 把生成顺序和跨模态可见性变成可对照变量,为社区提供了一个公共测试平台。更重要的是,它展示了反事实转移数据——即从同一状态出发执行不同动作序列——能够超越仅依赖成功演示的监督,改善独立训练的动力学模型。目前公开信息显示,这仍属论文阶段成果,并非已上线产品。

对用户/开发者/创作者的影响

对机器人学习开发者而言,OpenWAM 的模块化设计降低了实验成本:可以固定视频骨干和训练配方,单独测试 VTA、ATV、Joint、Decoupled 四种交互路径,或替换局部 IDM/FDM 组件。对具身智能创作者来说,反事实数据采集思路提示了一条低成本扩充监督信号的路径——不必只收集成功演示,也可以在仿真中回放状态并执行替代动作。对关注开源生态的人,该项目基于 Wan2.2-5B 构建,意味着后续可能出现更多基于开源视频模型的机器人策略适配工作。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

第一,代码和模型权重是否完整开源,以及是否支持非 LIBERO 的真实机器人平台。第二,反事实数据采集流程能否被其他团队低成本复现,还是依赖特定仿真器。第三,四种交互模式在不同任务上的表现差异是否有更系统的对比结论,目前公开摘要仅给出了部分评测数据。

来源:alphaXiv

celebrityanime
celebrityanime
文章: 28041

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注