一句话看懂:Hugging Face Papers 收录的论文摘要显示,Long-WAM 试图解决机器人实时控制中“要历史、但历史会拖慢动作”的矛盾。摘要称把上下文从 0.0 秒扩到 19.2 秒,GR-1 任务成功率由 63.3% 升至 78.7%,但前提是视频底座用自回归方式预训练。
事件核心:发生了什么
2026 年 10 月 7 日前后,Hugging Face Papers 出现一篇题为 Long-WAM 的论文摘要,提出面向因果世界动作模型的长上下文框架。核心判断是:机器人能“看到”更长历史,不等于会“用”这些历史;只有当视频底座经过自回归预训练,长上下文才带来明显收益。作者先用机器人和第一视角视频学习因果预测,不依赖动作标签,再在世界动作适配阶段保留“历史到未来”的结构。
摘要给出的关键数字是:在 RoboCasa GR-1 上,上下文从 0.0 秒增加到 19.2 秒,成功率从 63.3% 提升到 78.7%;改用双向预训练初始化则没有净收益。机器人领域自回归预训练还提高了 GR-1 与 LIBERO-Long 的峰值成功率。系统侧,Long-WAM 通过流式观测编码、异步执行和硬件加速,部署在 RTX 5090、DGX Spark 与 Jetson AGX Thor 上;摘要称 RTX 5090 上每个动作块连同未来视频潜变量预测耗时 107.4 毫秒。
为什么重要
过去不少机器人策略模型把“上下文长度”当作直接卖点,Long-WAM 的摘要提醒行业:长历史的收益取决于预训练目标是否匹配因果预测。如果结论成立,这会改变世界动作模型的训练路线选择,也会影响机器人基础模型在算力、延迟和任务成功率之间的取舍。
另一个信号是模型与系统被一起设计。实时机器人不能只追求参数量或视觉保真度,还要把编码、执行与硬件加速放进同一流水线。这对关注具身智能、AI 算力和边缘推理的团队都有参考意义。
对用户/开发者/创作者的影响
对开发者来说,摘要中最实用的信息是“历史长度”需要配合自回归预训练才有意义。如果后续开源代码或权重放出,做机器人模仿学习、长程操作和第一视角视频预训练的团队,可以优先验证自己的底座初始化方式,而不是单纯把窗口拉长。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
对算力与边缘部署团队,RTX 5090、DGX Spark、Jetson AGX Thor 被点名为可部署硬件,说明长上下文世界动作模型可能走向端侧与工作站混合部署。摘要还称在 Unitree G1 和 YAM 上完成实时部署,动态叠杯任务 95% 成功,而 Pi0.5 与 Fast-WAM 在 20 次尝试中均未成功——这属于论文摘要自述结果,目前公开信息显示尚未看到独立复现或完整评测细节。
值得关注的后续
一是论文全文是否公开训练细节、数据规模和消融实验,尤其是双向预训练为何无净收益。二是代码、模型权重和推理框架是否开源,能否在 Jetson 等边缘设备上复现 107.4 毫秒级别的动作块延迟。三是动态叠杯等任务结果是否被第三方复现,以及 Long-WAM 作为“记忆型执行器”与更高层规划器组合时,在复合任务中能稳定到什么程度。


