PAIR框架让VLA模型感知到行动过渡更顺畅,真实任务成功率提升至65%

arXiv 一篇新论文提出 PAIR 框架,在视觉-语言-动作(VLA)模型中学习共享的感知-动作表征,试图让机器人从“看懂”到“行动”的过渡不再只靠最终动作损失隐式监督。摘要报告在仿真和真实任务上取得小幅提升。

一句话看懂:arXiv 一篇新论文提出 PAIR 框架,在视觉-语言-动作(VLA)模型中学习共享的感知-动作表征,试图让机器人从“看懂”到“行动”的过渡不再只靠最终动作损失隐式监督。摘要报告在仿真和真实任务上取得小幅提升。

事件核心:发生了什么

2026 年 10 月 8 日,arXiv cs.AI 发布一篇新论文(编号 2610.09016),标题为《PAIR: Bridging Perception and Action in Vision-Language-Action Models》。论文针对连续动作 VLA 模型的一个常见做法提出改进:多数模型把“描述场景和指令”到“生成机器人动作”之间的转换留成隐式过程,仅靠最终动作预测损失来监督。PAIR 框架则显式学习一个共享的中间表征。

具体做法是:训练时用一个掩码动作自编码器将专家动作块编码为与时间对齐的 Action Latent Tokens;一个 Bridge Module 从当前视觉-语言表征中提取任务相关特征,并与这些动作隐表征对齐,形成 Bridge Tokens。这些 Bridge Tokens 随后被投射到动作 token 空间,注入初始动作 token,为后续 Action Expert 精调提供起点。推理时去掉自编码器,仅凭当前观察和指令生成 Bridge Tokens。

摘要显示,在 LIBERO、LIBERO-Plus 和 CALVIN ABC-D 上,该方法对 OpenVLA-OFT 和 VLA-Adapter 两个模型均有提升。例如 LIBERO-Plus 上 VLA-Adapter 成功率从 59.1% 升至 64.2%;CALVIN 上平均完成序列长度从 4.42 升至 4.53;七个真实任务中 OpenVLA-OFT 成功率从 51.4% 升至 65.0%。以上均为论文摘要中的报告数据,未核验全文实验细节,也未说明是否经过同行评审。

为什么重要

VLA 是当前机器人与具身智能领域的重要技术路线,目标是把图像、语言指令直接映射为连续动作。但“感知表征”和“动作表征”之间的鸿沟,是许多模型难以泛化到新任务、新环境的原因之一。PAIR 的价值在于提出一种可插入现有模型的中间表征接口,而非重新设计一个全新架构。如果这种思路被后续工作验证,可能降低 VLA 模型对大规模动作标注的依赖,并提高跨任务迁移效率。

不过,目前公开信息限于论文摘要,尚不清楚该方法在不同机器人平台、动作频率和任务复杂度下的稳定性,也不确定训练成本增加多少。这更像是一个方法层面的探索,距离产品化或标准化还有距离。

对用户/开发者/创作者的影响

对机器人开发者而言,PAIR 提供了一种可参考的插件式思路:在现有 VLA 模型(如 OpenVLA-OFT、VLA-Adapter)上增加 Bridge Module 和动作隐对齐,可能以较小改动换取任务成功率提升。但需要自行复现并评估推理延迟和训练开销。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对具身智能创业公司和研究者,这类“共享中间表征”的方向值得跟踪,因为它可能影响未来开源 VLA 模型的微调范式。对普通用户,短期内没有直接可用的产品变化;机器人操作能力的提升仍需经过硬件集成和产品验证。

值得关注的后续

一是论文是否公开代码和预训练权重,让社区能复现 LIBERO 和真实任务上的结果;二是该方法能否在更多开源 VLA 模型(如 OpenVLA、RT-2 类模型)上验证,而不仅限于摘要提到的两个模型;三是工业界是否将类似 Bridge Tokens 的中间表征设计引入产品级机器人系统,并披露推理效率与成本数据。

来源:arXiv cs.AI

celebrityanime
celebrityanime
文章: 28212

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注