Introducing Cosmos 3 Edge

NVIDIA 于 7 月 20 日发布了拥有 40 亿参数的开放世界模型 Cosmos 3 Edge,专为在边缘设备上运行机器人、视觉 AI 代理而设计,旨在将数据中心级别的环境理解与实时推理能力压缩到内存受限的硬件上,模型已在 Hugging Face 开源。

Introducing Cosmos 3 Edge

一句话看懂:NVIDIA 于 7 月 20 日发布了拥有 40 亿参数的开放世界模型 Cosmos 3 Edge,专为在边缘设备上运行机器人、视觉 AI 代理而设计,旨在将数据中心级别的环境理解与实时推理能力压缩到内存受限的硬件上,模型已在 Hugging Face 开源。

事件核心:发生了什么

NVIDIA 在其 Hugging Face 仓库中正式释出 Cosmos 3 Edge 模型。该模型是基于此前 Cosmos 3 架构的后训练版本,参数量为 4B,专攻边缘计算场景。它能够在 NVIDIA Jetson T2000/T3000 模组、RTX PRO GPU、GeForce RTX GPU 以及 DGX 等平台上运行。关键性能指标包括:在边缘设备上实现机器人控制分辨率(640×360)下的实时推理,单次推理生成 32 个动作,并在 Jetson Thor 上达成 15Hz 的实时控制频率。在 VANTAGE-Bench 视觉分析榜单和机器人策略学习评估中,它被评为同尺寸模型中的第一名。

模型架构采用了双 transformer 塔设计:一个自回归塔处理视觉与文本 token 用于理解与推理,另一个扩散塔处理视觉、音频与动作 token 用于预测与生成。两者共享多模态注意力层,使得模型能够在语言、视频、音频和动作之间对齐信息。特别的,Cosmos 3 Edge 将不同形态的机器人动作(如车辆运动、机械臂末端位姿、夹爪开合)统一编码为包含平移、旋转和操作状态的紧凑几何向量,从而在像素变化与物理控制之间建立直接映射。

为什么重要

过去的主流世界模型大多依赖云端大规模算力,难以满足工厂、仓库、医院等边缘场景对低延迟和隐私的要求。Cosmos 3 Edge 通过将世界建模、视觉推理与动作生成合并到同一模型并压缩至 4B 参数量级,首次让开放模型在边缘设备上实现完整的“看-想-动”闭环。此举不仅降低了机器人开发和部署的硬件门槛(现有 Jetson 平台即可运行),更通过开源策略直接挑战了过去依赖闭源方案进行机器人行为训练的格局。它向行业发出的信号是:物理 AI 的边缘化落地不再需要等待算力革命,而是可以从模型架构本身的创新开始。

对用户/开发者/创作者的影响

对于机器人开发者,该模型可以直接作为视觉-语言模型或策略模型使用,无需在云端和边缘端之间来回传输推理结果,能显著简化系统复杂度并提升响应速度。对于智慧基础设施的集成商,模型内置的通用动作表示(平移、旋转、操作状态)意味着它能够适配多种硬件平台(相机、机器人臂、移动底盘),减少了为不同设备分别训练模型的成本。对于研究者,开源仓库提供了完整的推理代码和多个边缘硬件上的性能基准,可以快速在自己的 Jetson 或 RTX GPU 上进行实验与微调。

值得关注的后续

目前公开信息显示,该模型仅发布了推理权重,尚未公开完整的训练或微调框架。后续值得关注两个方向:一是 NVIDIA 是否会在近期更新 Cosmos 3 的基线模型以同步边缘优化成果;二是竞品公司(如 Meta、Google 或新兴的机器人 AI 初创)是否会跟进推出同等参数级别的开源边缘世界模型。此外,Jetson T2000/T3000 模组必须搭配新硬件出货才能达到标称性能,其实际市场供货与定价情况将直接影响开发者的采纳意愿。

来源:Hugging Face Blog

celebrityanime
celebrityanime
文章: 14628

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注