超越VLA:World Action Models如何重塑机器人操作

NVIDIA 研究人员提出用视频世界模型替代视觉语言模型,作为机器人操作策略的骨干网络,形成“世界动作模型(WAM)”,让机器人理解物理规律而非仅模仿示范动作,从而在陌生环境中更好地泛化。

一句话看懂:NVIDIA 研究人员提出用视频世界模型替代视觉语言模型,作为机器人操作策略的骨干网络,形成“世界动作模型(WAM)”,让机器人理解物理规律而非仅模仿示范动作,从而在陌生环境中更好地泛化。

事件核心:发生了什么

NVIDIA Generative AI Blog 发表文章,系统梳理了机器人操作策略从 VLA(视觉-语言-动作模型)向 WAM(World Action Model)演进的技术逻辑。传统 VLA 以预训练视觉语言模型为骨干,虽然能理解场景语义和语言指令,但无法预测场景如何随时间演化——例如杯子被夹爪握住后会怎样、毛巾如何折叠、物体释放后会落在哪里。WAM 则将骨干替换为视频世界模型,让模型在学习动作之前先学习世界动态。

作为支撑,NVIDIA 发布了 Cosmos 3 世界基础模型,采用 Mixture-of-Transformers(MoT)架构,可同时处理文本、图像、视频、音频和动作等模态。它提供 4B(Edge)、16B(Nano)、64B(Super)三种尺寸,训练数据包括约 7.67 亿张图像、3.48 亿段真实世界动态视频,以及 800 万个动作样本,覆盖机器人操作、自动驾驶、相机运动和第一人称运动。基于 Cosmos 3 Nano 微调得到的 Cosmos3-Nano-Policy-DROID 是一个 160 亿参数的机器人策略模型,面向 Franka Panda 机械臂与 Robotiq 夹爪平台。

为什么重要

这一转向触及机器人泛化能力的根本瓶颈。VLM 骨干被优化用于“描述”世界,而非“预测”世界如何变化;VLA 在语义泛化上表现良好,但在物理泛化上受限——物体形状、位置、光照一旦改变,策略容易失效。WAM 因为骨干已经具备物理先验,微调时不需要从零学习动力学,而是将既有物理理解适配到具体任务上。

NVIDIA 研究员 Jim Fan 在演讲中将其概括为“VLAs are dead, long live World Action Models”,这并非断言 VLA 立即被淘汰,而是强调预训练骨干的选择决定了策略能力的上限。对行业而言,WAM 路线可能改变机器人数据的价值逻辑:多样化交互数据(如推、抓、放)都能成为训练信号,而非要求大量同任务示范,这在数据采集成本极高的机器人领域具有实际意义。

对用户/开发者/创作者的影响

对机器人开发者和研究团队,WAM 的吸引力在于数据效率与迁移能力。一个已经理解物理互动的模型,适配新机械臂或夹爪时只需少量示范数据;同时,跨场景的物理行为(如物体下落、滑动)具有通用性,模型可将在训练场景中学到的动态规律迁移到未见过的环境。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对使用机器人云服务或自动化方案的企业,这意味着未来机器人策略的部署成本可能下降——如果 WAM 预训练模型能像大语言模型一样通过后训练快速适配具体工位,定制化机器人方案将不必为每个场景重新采集大量示范数据。目前公开信息显示,Cosmos 3 及 DROID 策略模型的具体开放方式和授权条款尚未完全披露,实际开发者体验仍有待验证。

值得关注的后续

一是 DROID 微调模型能否在真实物理环境中稳定复现论文中的零样本表现,这比 Bench 数据更值得追踪;二是 Cosmos 3 的开源策略,NVIDIA 是否会像 Cosmos 系列前代一样提供开放权重,将直接影响开发者社区能否围绕 WAM 形成生态;三是数据规模是否成为新壁垒——7.67 亿图像与 3.48 亿视频覆盖真实世界动态,这类物理世界数据集的积累速度可能决定不同玩家在 WAM 赛道上的起跑位置。

来源:NVIDIA Generative AI Blog

celebrityanime
celebrityanime
文章: 16914

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注