冻结导航器+TGIT翻译器:弱指令成功率从11.33%升至37.93%

一篇 arXiv 新论文提出“轨迹锚定指令翻译器”(TGIT),在不重训导航模型的情况下,把用户简短意图指令翻译成导航器能执行的命令,使冻结 OpenFly 导航器在弱指令下的成功率从 11.33% 提升到 37.93%。

一句话看懂:一篇 arXiv 新论文提出“轨迹锚定指令翻译器”(TGIT),在不重训导航模型的情况下,把用户简短意图指令翻译成导航器能执行的命令,使冻结 OpenFly 导航器在弱指令下的成功率从 11.33% 提升到 37.93%。

事件核心:发生了什么

2026 年 10 月 9 日提交到 arXiv cs.AI 的一篇论文(arXiv:2610.10635v1)指出,空中视觉语言导航(Aerial VLN)智能体通常使用细节丰富、与轨迹对齐的指令训练,但真实用户更习惯发简短、意图驱动的指令。在冻结的 OpenFly 导航器上,这种“指令鸿沟”导致成功率(SR)从 31.03% 降到 11.33%。

作者先借助语言模型和人工风格示例,把原始命令改写成成对的“弱指令”,这类弱指令的 SR 为 15.27%。随后提出 TGIT:保持导航器冻结,仅作为前端翻译模块,通过学习导航器的轨迹结果,把弱输入翻译成可执行命令。摘要中报告,经弱数据训练的翻译器把弱输入 SR 提升到 37.93%,并零样本迁移到真实人类指令(11.33%→32.51%),在留出的 OpenFly 上从 4.95% 提升到 20.79%,在 CityNav 和 AirVLN 上也出现恢复效果。以上数据均来自论文摘要,全文实验尚未核验。

为什么重要

这项研究触及具身智能和 VLN 落地中的一个常见矛盾:模型训练数据与真实用户表达方式不匹配。传统做法是重新训练或微调导航器,成本高且可能影响已有能力。TGIT 选择“冻结导航器、只换前端”,把翻译层当作适配器,这为已有导航大模型提供了一条低成本的指令适配路径。目前公开信息显示,该思路与机器人、无人机等需要在真实环境中理解自然语言的场景有直接关联。

对用户/开发者/创作者的影响

对开发者而言,TGIT 的价值在于不触碰导航器权重,即可提升弱指令和真实人类指令的成功率,可能降低垂直场景的再训练算力开销。对做无人机配送、巡检或内容创作的团队,这意味着用户可以用更口语化的指令操控现有 VLN 模型,而不必先学习系统偏好的“详细命令语法”。但需要注意,摘要中没有披露翻译器的推理延迟、部署成本和对不同语言指令的泛化表现,实际集成前仍需验证。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是 TGIT 是否会开源或提供可复现的 API,让开发者在 OpenFly 之外验证其迁移能力;二是真实人类指令从 11.33% 提升到 32.51% 的零样本结果,能否在更多数据集和不同导航器上复现;三是如果该前端被集成进无人机或机器人产品,推理延迟和错误翻译带来的安全风险将被如何控制。

来源:arXiv cs.AI

celebrityanime
celebrityanime
文章: 28538

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注