一句话看懂:arXiv 2026 年 10 月 8 日上线的一篇新论文提出 PAIR 框架,在视觉-语言-动作(VLA)模型中显式学习“感知-动作”共享中间表征,让模型在生成动作前就拿到动作就绪的起点。摘要显示,该方法在 LIBERO、LIBERO-Plus、CALVIN ABC-D 以及七个真实任务上给 OpenVLA-OFT 和 VLA-Adapter 带来提升。
事件核心:发生了什么
这篇论文关注的是一类连续动作 VLA 模型:它们把图像观测和语言指令直接映射为机器人连续动作。多数做法把“理解场景”到“生成动作”的转换留在黑盒里,只用最终动作预测损失来监督。PAIR 的做法是引入一个共享的感知-动作表征:训练时用 Masked Action Autoencoder 把专家动作片段编码成与时间跨度对齐的 Action Latent Tokens,再由 Bridge Module 从当前视觉-语言表征中提取任务相关特征,并将其与动作潜在 token 对齐,形成 Bridge Tokens。这些 Bridge Tokens 被投影进动作 token 空间并注入初始 Action Tokens,作为 Action Expert 细化的起点。推理时去掉自编码器,Bridge Tokens 仅由当前观测和指令生成。
摘要给出的数据是:在 LIBERO-Plus 上,PAIR 把 VLA-Adapter 的成功率从 59.1% 提到 64.2%;在 CALVIN 上,平均完成序列长度从 4.42 提到 4.53;在七个真实世界任务中,OpenVLA-OFT 的成功率从 51.4% 提到 65.0%。这些结果均来自论文摘要,实验条件、基线配置和统计口径尚未核验全文。
为什么重要
VLA 是当前机器人与多模态大模型交叉的热门方向,核心难点在于“看懂”和“做对”之间缺少可监督的中间层。PAIR 的思路不是把视觉语言模型直接接到动作头上,而是显式构造一个动作感知的中间接口,让连续动作的结构信息在动作专家细化之前就可被访问。对行业而言,这代表一条可能更可解释、更易训练的技术路线:如果共享中间表征有效,未来 VLA 的预训练、微调和跨机器人迁移可能不必完全依赖端到端动作损失。开源与闭源机器人基础模型若跟进类似接口,可能影响 VLA 的评测基准与训练成本结构。
对用户/开发者/创作者的影响
对做机器人应用和具身智能的开发者来说,PAIR 目前仍是论文层面的方法,不是可直接调用的 API 或产品。它的价值在于提示:在接入大模型做动作生成时,可以设计额外的中间表征监督,而不是只调最终动作损失。若后续有开源实现,可能降低在 LIBERO、CALVIN 等基准上复现强基线的门槛;对做真实机械臂任务的企业,摘要中七个真实任务的成功率提升值得跟踪,但目前公开信息显示仍不足以判断其跨硬件、跨任务的泛化能力。对内容创作者而言,这条新闻本身不涉及图像生成或内容工具,影响主要在技术理解层面。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
一是 PAIR 是否发布代码或权重,以及是否在 OpenVLA-OFT、VLA-Adapter 之外的模型上复现;二是 Bridge Tokens 的表示分析能否在更多真实机器人平台上验证,而不仅限于摘要提到的任务;三是 VLA 社区是否会跟进类似的“感知-动作共享中间层”设计,并影响后续基准的评测方式。
来源:arXiv cs.AI


