一句话看懂:World Labs 正式发布新一代世界模型 Atlas,这是一个原生支持文本、图像、视频和 3D 四种模态的统一模型,能实现精准可控的摄像机运动、稀疏视图 3D 重建以及长视频生成。它标志着“空间智能”从概念演示走向通用基础模型阶段,也是 OpenAI 前科学家李飞飞团队对具身智能与 3D 生成赛道的一次重要卡位。
事件核心:发生了什么
据 World Labs 官方博客,Atlas 是一个从零预训练的全模态(omni model)世界模型,架构为多模态自回归扩散 Transformer。其关键设计在于将文本、图像、视频和 3D 输入统一编码进一个“共享空间上下文”,每一张图像都被锚定在 3D 空间坐标上,模型基于该上下文预测“下一步”,从而在 3D 一致性上保持稳定。
Atlas 目前已展示四大核心能力:一是摄像机控制生成,支持从 1 到 6 张参考图生成最长 1 分钟、1440p 分辨率的视频,且摄像机路径采用精确几何参数而非自然语言描述;二是空间重建,可接受 1 至数十张输入图重建真实场景,输出新视角图像与显式 3D 数据,据称在稀疏视图重建上优于现有专用模型;三是时空模拟,可对输入视频进行重取景,并能支撑机器人领域的 Real-to-Sim(真实到仿真)工作流;四是文本生成图像,支持复杂提示词与 360 度全景图输出。
官方表示,Atlas 的性能随训练算力提升而改善,未来将作为 Marble 及其他 World Labs 产品的基础引擎。目前产品处于早期访问申请阶段,尚未公开 API 或商用价格。
为什么重要
Atlas 的核心意义不在于单一功能突破,而在于验证了一条技术路线:将 3D 几何作为模型的“原生输入类型”,而非依赖文本间接控制视角。这种做法直接对标当前视频生成模型“摄像机控制靠提示词猜”的痛点,把空间一致性从概率输出转变为可计算的几何约束。
从行业竞争看,World Labs 由李飞飞联合创办,定位是“空间智能”通用模型,与主攻文本推理的大模型厂商形成差异化。Atlas 采用的自回归扩散 Transformer 架构也暗示,3D 世界模型并不必然需要走纯扩散或纯自回归路线,多模态融合的“空间上下文”可能成为新的训练范式。此外,Real-to-Sim 能力直指具身智能训练数据短缺问题,这对机器人公司而言意味着更低成本的仿真数据生成方案。
需要指出的是,目前公开信息主要是技术展示与效果视频,尚未公布模型参数量、训练数据规模、推理成本或第三方评测基准。因此其“优于 SOTA”的表述尚需独立验证。
对用户/开发者/创作者的影响
影视与内容创作者:Atlas 的像素级摄像机控制和长视频生成(1 分钟 1440p)意味着“导演式”工作流成为可能——创作者先设计场景空间布局与摄像机路径,模型负责填充视觉细节,而非逐帧抽卡式生成。这降低了高质量动态分镜的制作门槛。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
3D 视觉开发者:稀疏视图重建能力值得关注。传统神经辐射场或多视图立体方法通常需要数十张密集图像,Atlas 声称可以从个位数图像重建场景并补齐未见区域。不过其输出形式(网格、点云还是隐式表示)以及是否提供本地部署或云 API,仍是技术选型的关键未知项。
机器人研发团队:Real-to-Sim 工作流可将真实视频转化为可交互的仿真场景,用于策略训练与测试。但该能力目前仅在官方演示中出现,能否支持复杂物理交互(如物体受力响应)尚无数据支撑。
值得关注的后续
第一,早期访问开放后的实际体验反馈——特别是重建精度、长视频连贯性和推理耗时,这些将决定其能否从“演示惊艳”走向“生产可用”。
第二,World Labs 的商业模式选择:MPS 芯片成本高企,全模态模型若走闭源 API 路线,定价策略与其他视频生成工具(如 Sora、Runway)相比是否具备竞争力。
第三,技术生态辐射:Marble 产品何时接入 Atlas、是否开放第三方开发者接口,以及该模型能否被 NVIDIA、Meta 等公司的具身智能框架采用,将影响其行业渗透速度。


