蚂蚁灵波发布空间原生视觉模型,边界掩码建模提升机器人感知
蚂蚁灵波发布全球首个空间原生视觉模型LingBot-Vision,用边界强制掩码方法,以1/10数据实现堪比7B参数DINOv3的性能。
蚂蚁灵波开源了面向具身智能的视觉基础模型LingBot-Vision,参数量1.1B。该模型采用"以边界为中心的掩码建模",在预训练时主动遮盖图像中物体边界区域,迫使模型学习几何结构。训练数据仅1.61亿张,远少于DINOv3的16.89亿张,迭代量不到其1/3,但深度估计性能已超越7B参数的DINOv3。
正文摘录
.jpg) 编辑|Panda 6 月 8 日,工信部和国资委联合发文,要求机器人今年底从「表演模式」转向「 作业模式 」。但斯坦福《AI Index 2026》报告给出的现实却不乐观:机器人在实验室任务 RLBench 上成功率已近 90%,但到了包含 1000 项真实家庭活动的 BEHAVIOR-1K,当前 SOTA 模型成功率仅有 12.4% 。 「表演模式」考验动作,「作业模式」则考验智能;要让智能真正走进真实世界,首先离不开可靠的 空间感知 ,而这正是当前机器人视觉模型普遍面临的短板。就连参数量高达 7B 的 DINOv3 也未能幸免:长时间训练后,模型的感知能力会下滑,还得靠 Gram Anchoring 来补救。说到底,这些模型的目标大多是为了看懂图片里有什么(语义),但机器人真正需要的是理解距离、边界、空间关系,以至于 SOTA 模型 DINOv3 也需要「边盖楼边补地基」。 就在今天,蚂蚁灵波从另一条路线给出了解答:发布新一代 空间感知模型 LingBot-Depth 2.0,并开源面向具身智能的视觉基础模型 LingBot-Vision。[](https://mp.weixin.qq.com/s/3C6ndYsu5T3h6l6hfiZHsA) 这条路线的核心是选择在打地基时就把空间结构原生刻进训练目标里,也即「 空间原生 」。