具身智能新突破:蚂蚁集团开源 LingBot-Vision,让机器人拥有「空间感」

蚂蚁集团旗下具身智能公司 Robbyant 于 2026 年 7 月 8 日开源了视觉模型家族 LingBot-Vision,它通过“边界建模”让机器人理解物体的形状、轮廓和深度,而非仅识别物体是什么。该模型在深度感知任务上以 11 亿参数超越了 70 亿参数的竞品,且训练数据量仅为后者三分之一。

具身智能新突破:蚂蚁集团开源 LingBot-Vision,让机器人拥有「空间感」

一句话看懂:蚂蚁集团旗下具身智能公司 Robbyant 于 2026 年 7 月 8 日开源了视觉模型家族 LingBot-Vision,它通过“边界建模”让机器人理解物体的形状、轮廓和深度,而非仅识别物体是什么。该模型在深度感知任务上以 11 亿参数超越了 70 亿参数的竞品,且训练数据量仅为后者三分之一。

事件核心:发生了什么

蚂蚁旗下的 Robbyant 在 Hugging Face 平台以 Apache-2.0 协议开源了 LingBot-Vision 模型家族。这套自监督视觉 Transformer 模型的核心创新在于将“物体边界”作为预训练信号,而非传统的“物体识别”。通过掩码边界建模技术,模型能主动聚焦图像中信息最丰富的边界区域进行训练,从而同步获得语义理解和几何空间感知能力。旗舰版 ViT-g/16 仅有 11 亿参数,在 NYU-Depth v2 深度估计数据集上表现最优,超越拥有 70 亿参数的 DINOv3。同时,团队还发布了从 300M 参数到更小规模的蒸馏版本,并同步升级了深度补全系统 LingBot-Depth 2.0,针对透明物体等感知难题有显著提升。

为什么重要

长久以来,视觉基础模型主要训练目标是让机器“认出画面中有什么”,但机器人执行抓取、避障、导航等物理交互任务时,更需要的其实是“物体在哪里、边界在哪里、离我有多远”。LingBot-Vision 通过“边界建模”这一技术路线,直接回应了具身智能的核心瓶颈:空间感知。它验证了一个低成本范式——用更少的参数和更小的数据量,就能在密集空间感知任务上达到甚至超越大模型水平。这对于降低具身智能的算力门槛、推动机器人从实验室走向实际物理环境有直接意义。同时,开源协议也让更多研究者和企业可以在此基础上迭代,而非依赖封闭的顶尖视觉闭源方案。

对用户/开发者/创作者的影响

对机器人开发者:可以直接从 Hugging Face 下载从 giant 到 small 四个尺寸的权重和推理代码。对于计算资源有限的场景(如家用机器人、机械臂边缘部署),小模型版本能提供低成本的空间感知能力,不必再依赖云端大模型。对 AI 研究人员:“边界建模”的训练方法(掩码边界建模)提供了一种新的预训练思路,尤其在需要深度估计、三维重建的任务中具有直接参考价值。对企业采购决策者:在评估机器人或自动化方案时,可关注是否采用了基于空间感知而非纯识别的视觉方案。LingBot-Vision 的数据和开源技术可以作为比较基准,帮助判断供应商的技术成熟度。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

1. 生态落地速度:LingBot-Vision 是否能快速整合进主流机器人操作系统(如 ROS 2)或边缘计算 SDK,直接影响其在产业中的应用深度。2. 竞争格局变化:目前公开信息显示,传统视觉大模型(如 DINOv3、CLIP)在空间感知任务上的优势被挑战,后续是否会有更多厂商转向“边界建模”路线,值得追踪。3. 数据效率的长期验证:团队声称该模型性能未出现传统模型的饱和现象,随着数据量增加而持续优化,这是一个关键论断,需要更多公开基准和第三方复现来验证。

来源:Readhub · AI

celebrityanime
celebrityanime
文章: 14834

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注