SuperNav提出智能体导航新范式:不微调MLLM,用工具调用完成任意场景任务

2026年10月8日,Hugging Face Papers收录的论文提出SuperNav,让预训练多模态大模型(MLLM)不经过导航专项微调,仅通过智能体工具链和图像指向接口完成跨场景导航,在四类基线对比和HM3D类别级评测中表现更优。

一句话看懂:2026年10月8日,Hugging Face Papers收录的论文提出SuperNav,让预训练多模态大模型(MLLM)不经过导航专项微调,仅通过智能体工具链和图像指向接口完成跨场景导航,在四类基线对比和HM3D类别级评测中表现更优。

事件核心:发生了什么

通用服务机器人要应对陌生环境中的多样化人类指令,需要同时具备任务通用性和场景通用性。常见做法是微调MLLM直接预测导航动作,但论文作者认为这种路线受限于导航训练数据的覆盖范围,对未曾见过的请求和环境泛化能力有限。SuperNav的核心思路是让MLLM保留通用理解与决策能力,把运动执行交给导航工具,通过“智能体骨架”连接决策与动作。具体包括:导航技能(Navigation Skills)、面向智能体的物理交互工具、任务进度与上下文管理,以及一个统一的视觉点接口,让模型直接在图像上指定目标,并根据执行反馈修正决策。论文摘要显示,SuperNav在实例级、多目标和需求驱动任务上优于四个被评测基线,并在HM3D上完成类别级评测,同时部署于真实四足机器人。

为什么重要

这项研究挑战了当前具身智能领域一条主流路线:把大模型微调成端到端导航策略。SuperNav选择不微调MLLM,而是用工具调用和视觉接口补足运动能力,让通用大模型不必为导航任务牺牲原有的语义理解和推理能力。如果这条路线成立,导航系统的泛化成本可能从“重新采集数据、重新训练”转向“定义技能与工具接口”,对开源模型和闭源API的集成方式也会产生影响。论文同时给出真实四足机器人部署结果,说明该方法不只是仿真环境中的概念验证,但目前公开信息仅为摘要,完整实验条件、任务规模和失败案例仍需查看全文。

对用户/开发者/创作者的影响

对机器人开发者而言,SuperNav提供了一种“不碰模型权重”的导航集成思路:预训练MLLM负责理解指令和场景,导航技能与物理工具负责执行,视觉点接口作为中间协议。这意味着开发者可以复用现有大模型能力,而不必为每个新场景收集动作标注数据。对关注多模态大模型应用的人来说,论文再次验证了工具调用在具身任务中的价值。不过,摘要未披露技能库规模、工具调用延迟、算力需求和失败率,实际部署门槛尚不明确。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是项目页是否公开代码、技能定义和评测细节,这决定开发者能否复现;二是SuperNav在更大规模真实环境中的任务成功率与响应延迟,尤其是多步长程任务;三是是否有团队跟进“不微调大模型+工具调用”的导航路线,以及该方法与端到端微调方案在成本和灵活性上的实际对比。

来源:Hugging Face Papers

celebrityanime
celebrityanime
文章: 28538

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注