ViSkill:用可进化的视觉技能卡强化 VLM 智能体的闭环框架

2026 年 10 月,来自 ZJU-REAL 的研究者发布 ViSkill,将成功交互蒸馏为“视觉技能卡”并直接供 VLM 智能体检索使用,让技能积累与策略优化形成闭环。它在 Sokoban 等任务上取得 0.89 的综合成功率,冷启动后升至 0.91。

一句话看懂:2026 年 10 月,来自 ZJU-REAL 的研究者发布 ViSkill,将成功交互蒸馏为“视觉技能卡”并直接供 VLM 智能体检索使用,让技能积累与策略优化形成闭环。它在 Sokoban 等任务上取得 0.89 的综合成功率,冷启动后升至 0.91。

事件核心:发生了什么

根据 alphaXiv 上的论文页面,ViSkill 是一个面向 VLM 智能体的视觉原生技能学习框架。它把成功轨迹编码成一张复合“视觉技能卡”,卡中同时包含带标注的原始轨迹帧和从策略中蒸馏出的高层策略,并附带几何描述子与历史效用。任务开始时,环境特定的提取器解析布局几何,检索模块按几何相似度和历史效用排序,只有分数超过阈值的卡片才会被提供给 VLM。

新技能并非照单全收:只有成功轨迹才有资格,还须通过轨迹长度质量预算和新颖性检测。检索到的技能既指导推理,也参与奖励塑形;成功轨迹再被蒸馏回技能库,形成闭环。论文摘要称,在 Sokoban、FrozenLake 和 PrimitiveSkill 上,ViSkill 的综合成功率为 0.89,加入冷启动初始化后为 0.91,优于所评估的闭源与开源基线,且比标准 PPO 收敛更快。目前公开信息显示,这些结果限于论文所述任务和评测条件。

为什么重要

现有技能增强智能体大多以文本为中心,把空间布局和动作状态对应关系线性化成语言,容易丢失关键几何结构;而部分引入视觉证据的工作,又往往把技能构建与策略优化分开做。ViSkill 的思路是让技能库以视觉卡形式存在,并且与策略优化彼此加强。论文中的消融实验显示,在 Sokoban 上 ViSkill 成功率 0.82,OCR-Skill 为 0.68,Text-Skill 为 0.63,这为“视觉轨迹本身有价值”提供了受控证据,但不等于证明视觉卡是全部性能的唯一来源。

对用户/开发者/创作者的影响

对做 AI 智能体、强化学习和 VLM 应用的开发者来说,ViSkill 值得关注的点在于“技能复用”的工程路径:不是把经验写成提示词,而是存成可检索的视觉卡,并配几何描述子和效用评分。这为机器人操作、游戏 NPC、流程自动化等需要空间推理的场景提供了一种可参考的架构。论文提到代码已在 ZJU-REAL/ViSkill 开源,但实际可用性、接口稳定性与复现成本,仍需看后续代码和文档。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

第一,检索到的技能在路线不经过卡中状态时,指导可能受限,作者也在论文中承认这一边界;第二,奖励塑形在失败轨迹上给出有界部分学分,其信号始终低于任务完成奖励,这种设计在更复杂环境里是否成立值得观察;第三,ViSkill 目前是论文成果而非已上线产品,接下来要看它是否被更多任务验证,以及开源社区能否复现 0.89/0.91 的成绩。

来源:alphaXiv

celebrityanime
celebrityanime
文章: 28629

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注