李飞飞团队推出世界模型 Atlas,或成通往 AGI 的核心原语

李飞飞团队在 a16z 交流中公开了多模态世界模型 Atlas,核心能力是“新视角预测”——输入几张图片即可生成任意空间位置的图像。它把传统 3D 重建的数据需求从数百张照片降到几张,被视为大模型“下一 token 预测”之外的另一条基础技术路线。

一句话看懂:李飞飞团队在 a16z 交流中公开了多模态世界模型 Atlas,核心能力是“新视角预测”——输入几张图片即可生成任意空间位置的图像。它把传统 3D 重建的数据需求从数百张照片降到几张,被视为大模型“下一 token 预测”之外的另一条基础技术路线。

事件核心:发生了什么

在近期与风投机构 a16z 的交流中,李飞飞及其 World Labs 核心团队正式展示了多模态世界模型 Atlas。与依赖预测下一 token 的大语言模型、预测下一帧的视频生成模型不同,Atlas 将“新视角预测”作为核心范式:用户输入某个场景的若干张图片或相关文字描述,模型即可输出任意空间与时间位置的画面,并原生处理文本、图像、视频、3D 数据及相机位姿等多模态信息。

据团队介绍,Atlas 是此前 Marble 模型的迭代版本。早期 Marble 采用高斯泼溅作为输出表示,存在技术瓶颈;Atlas 改为将“新视角预测”作为基础原语,解决了传统 3D 重建中的盲区问题,且具备可扩展的空间上下文窗口。在效率上,传统 3D 重建通常需要数百上千张照片,而 Atlas 仅需几张到几十张图像即可完成;例如用三部 iPhone 拍摄的照片,就能生成类似电影特效的子弹时间视频。

为什么重要

李飞飞团队将“新视角预测”类比为大语言模型中的“下一 token 预测”,并认为这可能是通往 AGI 的关键基础原语之一。这一提法值得关注,因为它指向了与当前主流生成式 AI 不同的技术路径:大模型侧重语言与符号推理,视频模型侧重时序生成,而 Atlas 试图在一个模型内同时实现“生成”与“重建”,直接建模空间几何与物理世界。

如果该路线成立,意味着 3D 内容生产不再依赖昂贵的多视角采集和传统重建算法,而是可以通过少量输入直接预测完整空间。这可能在技术层面改变 3D 重建、机器人仿真数据生成等领域的成本结构,也与英伟达等公司推动的“世界模型”方向形成竞争与参照。

对用户/开发者/创作者的影响

对创作者而言,Atlas 降低了高质量 3D 内容的制作门槛——过去需要专业设备与大量拍摄,现在用普通手机拍摄少量素材即可生成具有空间一致性的画面,可应用于影视分镜、游戏资产与虚拟拍摄。对开发者来说,模型提供高度的空间理解能力,有助于在建筑设计与工程领域实现更精准的空间预测与可视化,减少实地测绘成本。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

在机器人领域,Atlas 可提升从真实环境到仿真测试的转换效率。机器人训练长期受困于真实交互数据不足,若 Atlas 能低成本生成多样化空间场景,开发者可更快获得用于强化学习与策略验证的环境数据。目前 Atlas 已具备初步动态处理能力,但尚未公开 API 或商用计划,工具型应用仍需等待后续开放。

值得关注的后续

目前公开信息显示,Atlas 仍处于研究展示阶段,开发者可关注三个方面:一是动态效果与内容编辑能力的后续迭代,团队已明确将改进人机交互;二是是否开放 API 或测试接口,这将决定其能否进入实际生产流程;三是其他大厂与创业公司在世界模型方向的跟进——此前谷歌、英伟达等均有类似布局,Atlas 能否以更低的算力成本实现同等效果,将直接影响其生态吸引力和商业化速度。

来源:AIbase

celebrityanime
celebrityanime
文章: 22221

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注