H-JEPA:端到端分层世界模型提升视觉规划成功率

Meta 等机构研究者提出 H-JEPA,把动作条件 JEPA 世界模型训练成端到端层级结构,让高层在更慢的抽象潜空间里长程预测,低层负责局部执行。论文称在 Visual AntMaze 等任务上,分层规划成功率明显高于单层 JEPA,且规划算力更低。

一句话看懂:Meta 等机构研究者提出 H-JEPA,把动作条件 JEPA 世界模型训练成端到端层级结构,让高层在更慢的抽象潜空间里长程预测,低层负责局部执行。论文称在 Visual AntMaze 等任务上,分层规划成功率明显高于单层 JEPA,且规划算力更低。

事件核心:发生了什么

根据 alphaXiv 上的论文页面,作者在 2026 年 10 月公开了 H-JEPA:一种端到端训练分层动作条件 JEPA 的配方。每一层都拥有自己的学习型潜空间,层级越高,预测步长越远——模拟模型中第一层对应 5 个环境步,往上依次跨 10 步和 20 步。规划采用自顶向下方式:顶层优化朝向目标的前进方向,每层的预测结果作为下一层规划器的子目标,直到最底层输出原始动作。

论文给出的关键数据是:在 Visual AntMaze 的 50 项任务评测中,三层 H-JEPA 成功率 73.3%(SE 3.5),单层 LeWM 为 18.0%(SE 3.5);规划器设置取自 100-TFLOP 规划预算。消融实验把收益归因于时间分解和更高层目标表示。加入逆动力学监督后,方法还扩展到 DROID 真实机器人视频,论文称分层在更低规划算力下改善离线规划保真度。

为什么重要

JEPA 路线主张在潜空间预测未来,而不是重建像素。长期以来,单层世界模型在长程规划上有个现实瓶颈:为了看得远,必须滚动很多小步,误差会累积;同一个表示又要兼顾精细控制和抽象目标匹配。H-JEPA 的核心意义在于,它把“不同时间尺度用不同表示”这件事做成端到端可训练方案,而不是靠手工设计多套模型或事后拼接。

作者提到用 SIGReg 正则化防止层级潜空间维度坍塌,这延续了 LeWM 一系的工作。如果这套训练配方稳定可复现,它会降低分层世界模型的工程门槛,对做机器人学习、视觉导航和具身智能的团队有直接参考价值。不过目前公开信息仍以论文页面为主,尚未看到大规模第三方复现。

对用户/开发者/创作者的影响

对机器人学习和具身智能开发者来说,H-JEPA 提供了一种更省规划算力的思路:把长程目标交给高层抽象表示,底层只处理短程执行。如果后续开源代码和预训练模型质量可靠,可能减少从零搭建分层控制器的工作量。研究者可以关注其与 LeWM、SIGReg 的兼容性,以及能否迁移到真实机械臂或移动平台。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对普通用户和内容创作者,这项研究暂时不会直接改变现有 AI 产品体验;它更接近底层规划技术,而不是可调用的 API 或图像生成工具。企业采购和投资判断上,可把它视为世界模型路线里“分层+端到端”方向的一个增量信号,但距离产品化仍有距离。

值得关注的后续

一是作者是否放出完整代码和复现步骤,以及社区能否在同等预算下复现 AntMaze 结果;二是真实机器人 DROID 视频上的评测细节是否经得起检验;三是这条路线能否与现有 VLA、模仿学习系统结合,形成可落地的长程规划模块。目前公开信息显示,这些方向尚未有产品级验证。

来源:alphaXiv

celebrityanime
celebrityanime
文章: 27842

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注