告别盲目像素预测:PhiZero开创“物理语言”先河,让AI世界模型学会像人一样思考

研究团队近日发布物理世界模型 PhiZero,放弃视频生成中“盲目预测像素”的做法,改用自监督学习得到的“物理语言”先做显式推理、再渲染视频,为解决视频模型物理一致性不足的痛点提供了新路线。

一句话看懂:研究团队近日发布物理世界模型 PhiZero,放弃视频生成中“盲目预测像素”的做法,改用自监督学习得到的“物理语言”先做显式推理、再渲染视频,为解决视频模型物理一致性不足的痛点提供了新路线。

事件核心:发生了什么

在视频生成被日益视为具身智能模拟器的当下,主流模型大多直接在像素空间预测未来帧,物体运动经常出现违背物理规律的偏差。为此,研究团队推出了物理世界模型 PhiZero。它的核心创新是提出一种名为“物理语言”的离散表示:通过自监督学习从海量户外视频中提取状态转换模式,捕获不同场景中的动态演化规则。

基于这一表示,PhiZero 采用“先推理、后渲染”架构:系统先在物理语言空间中推断未来演化轨迹,再由专用扩散解码器渲染成高清视频,将底层动力学模拟与像素级合成解耦。技术实现上,系统包含两个核心模块:物理语言分词器使用 transition-level Q-Former 捕捉相邻状态的变化,并结合有限标量量化生成紧凑的离散符号;物理语言推理器则用预训练的视觉-语言模型初始化,根据首帧和文本动作意图预测未来的物理语言序列。在 Physics-IQ Verified、PhyGround、WorldModelBench 等多项基准评测中,PhiZero 在物理推理和视频生成任务上均取得领先表现,能较真实地呈现碰撞位移、重力形变和复杂链式反应。

为什么重要

PhiZero 的路线价值在于把“理解物理”和“生成画面”分开处理。此前视频生成模型通常把物理规律隐式塞进像素预测中,结果不稳定;PhiZero 则先让模型在抽象符号空间做显式推理,再用扩散模型补全视觉细节。这种思路如果被验证可行,可能推动视频生成从“看起来合理”走向“物理上可预测”,对需要长期稳定模拟的具身智能

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

celebrityanime
celebrityanime
文章: 16198

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注