行业新闻

蚂蚁灵波开源首个空间原生具身视觉基模 LingBot-Vision

蚂蚁灵波开源首个空间原生具身视觉基模 LingBot-Vision

蚂蚁灵波开源视觉模型 LingBot-Vision,让机器人看清透明杯和远距离网球,提升空间感知能力。

蚂蚁灵波发布并开源了LingBot-Vision和LingBot-Depth 2.0,前者是首个空间原生的具身视觉基础模型——在预训练阶段就教会模型关注物体边界和几何结构,后者基于前者升级,在透明杯、远距离小目标等机器人视觉难点上,深度图更连续、边缘更清晰,直接提升机器人抓取和导航的稳定性。

正文摘录

蚂蚁灵波开源首个空间原生具身视觉基模:让机器人更懂真实世界 视频地址: https://mp.weixin.qq.com/s/z1iVG8ZKv3Rj8TOMB6eezQ 左侧画面是真实世界;中间是未经优化的原始深度图——杯子的轮廓破碎,杯壁与背景粘连,香槟塔几乎看不出形状,空洞明显;右侧则是 LingBot-Depth 2.0 的输出:杯子的边界、层级和整体结构更完整,顶部杯子、酒瓶、杯塔之间的空间关系清晰,连细长的透明水柱都可见。 这种差异对机器人意义重大:抓杯子时边界不准会抓偏;在家庭、商场、工厂持续移动时,深度结果破碎会导致后续规划和控制抖动。 这正是蚂蚁灵波发布 LingBot-Vision 和 LingBot-Depth 2.0 的核心原因——机器人看世界,最怕“差一点”。尽管具身智能近年火热,但落地真实场景时,许多问题会快速回到最底层:透明物体就是典型。透明杯壁在 RGB 画面中可见,但深度传感器和深度模型常在此处不稳定——有的区域补不上、有的边缘粘连、有的直接空洞。 LingBot-Depth 2.0 的输出更像为机器人补上一层稳定的空间骨架,尽力保持杯口、杯壁、杯身之间的几何关系。因为机械臂抓杯子不仅需要知道“这是杯子”,还需要知道边界、开口方向、可接近位置,以及手爪靠近时是否会碰到旁边那层杯子。 如蚂蚁灵波预告片所示:机器人先看到带有透明水柱的清晰深度图,知道水的位置,才能准确将水壶推到水柱下接满水。 视频地址: https://mp.weixin.qq.com/s/z1iVG8ZKv3Rj8TOMB6eezQ 以下例子中,一只狗在户外追逐网球。

阅读原文(qbitai.com)→

行业新闻十三2026-07-07原文

相关内容