World Labs推出全球首个多模态世界模型Atlas,像素级镜头控制拍出电影级“子弹时间”大片

由李飞飞创办的World Labs正式推出号称全球首个多模态世界模型的Atlas,它能在3D空间中精确控制镜头位置,从单张或数张图片生成电影级“子弹时间”视频,同时兼顾3D重建与模拟能力。

一句话看懂:由李飞飞创办的World Labs正式推出号称全球首个多模态世界模型的Atlas,它能在3D空间中精确控制镜头位置,从单张或数张图片生成电影级“子弹时间”视频,同时兼顾3D重建与模拟能力。

事件核心:发生了什么

据AIbase报道,World Labs于2026年9月2日推出多模态世界模型Atlas。该模型从零开始预训练,能接收包括相机运动在内的多模态输入,并将其转换为立体3D视图。与常见文生图或文生视频工具不同,Atlas的关键特性在于像素级的镜头控制:用户指定任意相机位置与角度,模型会生成与原始内容几何结构匹配的参考图像,并平滑扩展场景,自主补齐输入图像中不可见的细节。官方信息显示,Atlas可输出最高1440p分辨率、时长1分钟的高清视频。模型同时支持从数十张输入图像重建真实场景、生成新视角图片,并提供显式3D输出;也可通过输入视频建模空间与时间,支持机器人领域的真实到模拟工作流。此外,它还能从文本生成图片与360度全景图,支持复杂提示词与多种视觉风格。

为什么重要

Atlas的推出代表了生成式AI从“内容生成”向“世界模拟”方向迈进的重要一步。目前多数图像与视频生成大模型集中在2D像素层面的内容生成,而Atlas尝试将生成过程置于3D空间中进行,使相机运动、场景几何与内容生成在同一个模型内完成对齐。这种技术路线如果成立,意味着创作者无需依赖多阶段pipeline或外部3D软件,即可获得具有空间一致性的可操控画面,这对影视预演、虚拟拍摄、游戏资产生产等领域都可能产生直接影响。同时,World Labs作为由李飞飞创办的明星创业公司,其模型发布也会加剧AI视觉领域在3D理解与空间智能方面的竞争,促使更多团队在重建质量与生成可控性之间寻找新的平衡点。

对用户/开发者/创作者的影响

对影视与广告创作者而言,Atlas提供了一种低成本实现“子弹时间”或复杂运镜效果的路径,这类镜头传统上依赖多相机阵列或纯CG制作,成本较高。对3D内容开发者来说,模型能接受图像与视频输入并输出显式3D模型,可用作资产生成或场景重建的辅助工具,提升从实拍到数字资产的生产效率。对机器人或自动驾驶研究者而言,模型支持的真实到模拟工作流,可能有助于降低数据采集成本。需要留意的是,目前World Labs仅向部分合作伙伴开放了早期访问权限,计划在未来数周内向更多早期用户逐步开放,普通开发者暂时无法直接调用相关API或模型权重,公开信息尚未披露定价、开源计划或可用的调用接口。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

第一,关注Atlas开放早期访问后的实际生成质量与生成速度,目前官方展示的能力是否能在高并发或长视频场景中稳定复现仍需检验。第二,观察World Labs是否选择开源基座模型或开放API,这将直接影响其与现有开源3D重建模型及闭源视频生成工具的生态位对比。第三,留意包括Google DeepMind、Meta等在内的大厂在3D世界模型方向是否有对标产品跟进,以及Atlas在商业场景中的落地是否涉及算力成本过高或生成内容版权归属等后续问题。

来源:AIbase

celebrityanime
celebrityanime
文章: 21451

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注