一句话看懂:alphaXiv 上的一项论文预印本提出“物理终极考试”基准,用40项可测量物理任务评测视频世界模型,八款模型在1280段生成视频中普遍出现物理不一致,最高综合分仅为57.76。
事件核心:发生了什么
2026年10月6日,alphaXiv 收录了一篇关于视频世界模型物理一致性评测的论文预印本。作者提出名为“World Models’ Last Exam in Physics”的基准测试,覆盖力学、光学、流体、热学与相变、电磁学、表面张力等40项受控任务。每项任务包含初始图像、生成提示词和预设物理判据。评测器先做可观测性筛查,再通过跟踪、分割、几何拟合和时间分析提取位置、周期、角度、液面等物理量,最终与物理关系比对。
作者在八款视频生成模型上生成1280段视频,每对模型-任务生成四个样本。结果显示模型存在持续性的物理不一致,且任务间差异很大,最高综合分是 Seedance 2.5 的57.76分(满分100)。在光的反射任务上,Seedance 2.5得96.15分、VBVR得95.75分,其余六款不超过49.82分。
为什么重要
视频生成模型正被探索用于具身智能中的预测和规划,但“看起来逼真”不等于“物理正确”。现有评测多依赖模型判断或参考视频,直接物理测试又偏重力学。该基准用可测量证据替代主观观感,并公开测量局限,为诊断物理不一致提供可解释依据。
需要说明的是,这是论文预印本成果,并非已上线产品功能或官方排行榜。目前公开信息显示,其结论仅限该摘要所述任务集合与评测条件,不能外推为永久排名。
对用户/开发者/创作者的影响
对内容创作者,物理一致性仍是视频生成模型的短板,涉及光影反射、流体、电磁等高精度场景时,生成结果需人工校验,不能直接用于严肃仿真。对开发者和具身智能团队,该基准可作为模型选型与训练反馈的参考,但要注意它是基于测量的诊断工具,不是统一的物理正确性认证。对采购方,现阶段模型物理分数普遍偏低,若业务强依赖物理预测,需配套后处理或专用仿真管线。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
第一,看评测器是否会开放代码、数据集和榜单,供更多开发者复现。第二,看视频模型厂商是否将物理一致性纳入训练目标,并在光学、流体等高分差异任务上跟进。第三,看该基准能否从论文预印本走向更广的第三方验证,以及是否会扩展到更多物理领域和更长视频场景。
来源:alphaXiv


