Long-WAM 探索世界动作模型长上下文:19.2 秒历史把成功率抬到 78.7%

Hugging Face Papers 收录的论文摘要显示,Long-WAM 试图解决机器人实时控制中“要历史、但历史会拖慢动作”的矛盾。摘要称把上下文从 0.0 秒扩到 19.2 秒,GR-1 任务成功率由 63.3% 升至 78.7%,但前提是视频底座用自回归方式预训练。

一句话看懂:Hugging Face Papers 收录的论文摘要显示,Long-WAM 试图解决机器人实时控制中“要历史、但历史会拖慢动作”的矛盾。摘要称把上下文从 0.0 秒扩到 19.2 秒,GR-1 任务成功率由 63.3% 升至 78.7%,但前提是视频底座用自回归方式预训练。

事件核心:发生了什么

2026 年 10 月 7 日前后,Hugging Face Papers 出现一篇题为 Long-WAM 的论文摘要,提出面向因果世界动作模型的长上下文框架。核心判断是:机器人能“看到”更长历史,不等于会“用”这些历史;只有当视频底座经过自回归预训练,长上下文才带来明显收益。作者先用机器人和第一视角视频学习因果预测,不依赖动作标签,再在世界动作适配阶段保留“历史到未来”的结构。

摘要给出的关键数字是:在 RoboCasa GR-1 上,上下文从 0.0 秒增加到 19.2 秒,成功率从 63.3% 提升到 78.7%;改用双向预训练初始化则没有净收益。机器人领域自回归预训练还提高了 GR-1 与 LIBERO-Long 的峰值成功率。系统侧,Long-WAM 通过流式观测编码、异步执行和硬件加速,部署在 RTX 5090、DGX Spark 与 Jetson AGX Thor 上;摘要称 RTX 5090 上每个动作块连同未来视频潜变量预测耗时 107.4 毫秒。

为什么重要

过去不少机器人策略模型把“上下文长度”当作直接卖点,Long-WAM 的摘要提醒行业:长历史的收益取决于预训练目标是否匹配因果预测。如果结论成立,这会改变世界动作模型的训练路线选择,也会影响机器人基础模型在算力、延迟和任务成功率之间的取舍。

另一个信号是模型与系统被一起设计。实时机器人不能只追求参数量或视觉保真度,还要把编码、执行与硬件加速放进同一流水线。这对关注具身智能、AI 算力和边缘推理的团队都有参考意义。

对用户/开发者/创作者的影响

对开发者来说,摘要中最实用的信息是“历史长度”需要配合自回归预训练才有意义。如果后续开源代码或权重放出,做机器人模仿学习、长程操作和第一视角视频预训练的团队,可以优先验证自己的底座初始化方式,而不是单纯把窗口拉长。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对算力与边缘部署团队,RTX 5090、DGX Spark、Jetson AGX Thor 被点名为可部署硬件,说明长上下文世界动作模型可能走向端侧与工作站混合部署。摘要还称在 Unitree G1 和 YAM 上完成实时部署,动态叠杯任务 95% 成功,而 Pi0.5 与 Fast-WAM 在 20 次尝试中均未成功——这属于论文摘要自述结果,目前公开信息显示尚未看到独立复现或完整评测细节。

值得关注的后续

一是论文全文是否公开训练细节、数据规模和消融实验,尤其是双向预训练为何无净收益。二是代码、模型权重和推理框架是否开源,能否在 Jetson 等边缘设备上复现 107.4 毫秒级别的动作块延迟。三是动态叠杯等任务结果是否被第三方复现,以及 Long-WAM 作为“记忆型执行器”与更高层规划器组合时,在复合任务中能稳定到什么程度。

来源:Hugging Face Papers

celebrityanime
celebrityanime
文章: 28212

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注