认识 ‘Code-as-World’:一个将真实视频改写为可执行 MuJoCo 物理程序的智能体循环

Mirror 团队提出“Code-as-World”智能体循环,尝试把真实世界视频自动转化为可执行的 MuJoCo 物理仿真程序,让 AI 在虚拟环境中验证“看懂了什么”。这项研究值得关注,因为它直指具身智能和世界模型训练中“数据可用但不可控”的核心痛点。

一句话看懂:Mirror 团队提出“Code-as-World”智能体循环,尝试把真实世界视频自动转化为可执行的 MuJoCo 物理仿真程序,让 AI 在虚拟环境中验证“看懂了什么”。这项研究值得关注,因为它直指具身智能和世界模型训练中“数据可用但不可控”的核心痛点。

事件核心:发生了什么

MarkTechPost Research 报道,Mirror 团队发布了一项名为“Code-as-World”的研究,核心是一个智能体循环系统。该系统能够接收真实世界的视频输入,通过视觉理解提取场景中的物体、空间关系和物理属性,然后自动生成 MuJoCo 物理引擎可执行的仿真代码。目前公开信息显示,该工作重点解决了从非结构化视频到结构化物理程序之间的映射问题,生成的不是抽象描述,而是可以直接运行、可交互的“世界表示”。

为什么重要

当前具身智能和机器人学习高度依赖仿真环境,但传统的仿真场景构建高度依赖人工建模,成本高且难以覆盖真实世界的长尾分布。“Code-as-World”尝试将视频数据直接转化为可交互物理程序,这意味着训练数据的来源可以从受限的实验室采集扩展到大规模网络视频。这种做法有望降低仿真数据生产的边际成本,同时提升世界模型在真实场景中的泛化能力。它也可以被视为一种“可执行的世界模型”路线,与纯参数化的世界模型形成互补。

对用户/开发者/创作者的影响

对开发者而言,这项研究的直接价值在于可能缩短机器人控制策略的开发周期——过去需要手动搭建的物理场景,未来或许可以通过输入视频自动生成。对内容创作者和游戏开发者来说,这类技术如果成熟,可以辅助生成物理交互原型,降低 3D 场景搭建门槛。对普通用户而言,短期影响有限,但长期看,它可能推动更逼真的数字孪生应用落地,例如自动驾驶仿真测试、工业质检模拟等场景。需要说明的是,目前该项工作仍处于研究验证阶段,尚无公开的商用 API 或开源版本发布。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

首先,研究团队是否会开源代码和数据集,是决定其影响力的关键一步,开源将加速社区复现和迭代。其次,生成程序的物理准确性和运行效率尚需第三方评测,尤其在高动态场景和复杂接触关系下是否稳定,值得跟踪。最后,关注是否有大厂或机器人公司跟进类似路线,将其集成进训练管线,这将影响行业对“视频生成仿真”技术路线的信心。

来源:MarkTechPost Research

celebrityanime
celebrityanime
文章: 21340

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注