论文

Robostral Navigate

Robostral Navigate

大规模部署导航系统需要一种最小化传感器假设、跨机器人形态泛化且训练高效的方案。然而,当今最先进的系统依赖深度传感器、多摄像头装置或预建地图,限制了支持的硬件并增加了部署成本。我们提出 Robostral Navigate,一个 8B 视觉语言模型,围绕这一可扩展性目标构建。该模型仅消耗单目 RGB 图像流(机器人平台上最普遍的传感器),并通过指向当前视角中的下一个目标位置来预测航点。 模型仅在图像空间而非机器人特定坐标中运行,使其对相机内参和场景尺度变化具有天然鲁棒性,从而无需重新校准即可部署于轮式、足式和飞行机器人。我们生成了 240 万条轨迹,覆盖 35 万个模拟场景,以减少对真实世界数据收集的依赖并实现轻松扩展。此外,我们引入了 前缀缓存训练方案,将整个片段打包为单个训练序列,将训练 token 减少 22 倍,训练时间从数月缩短至数天。树形注意力掩码 防止模型依赖先前的真实动作,鼓励基于视觉的动作预测,并使用强化学习进一步提升探索和恢复能力。 在 R2R-CE 和 RxR-CE 基准上,Robostral Navigate 刷新了最优结果。在 R2R-CE 上,它达到 77.4% 成功率,超越最佳单目方法 10.5 个百分点,并超越最强的深度或多摄像头系统 5.3 个百分点,尽管仅使用单个 RGB 摄像头。在 RxR-CE 上,它达到 75.1% 成功率,超越所有单目基线。

论文精读

TL;DR Robostral Navigate 是一个 8B VLA 模型,仅凭单目 RGB 图像在图像空间直接预测导航点,实现跨轮式、足式、飞行机器人的零成本迁移,训练效率提升 22 倍,并在 R2R-CE/RxR-CE 上大幅刷新 SOTA。

问题

问题背景
具身指令导航(视觉-语言导航)是通用机器人的核心能力,领域当前聚焦于构建可扩展、跨形态的导航系统,以支持大量低成本平台的部署。

现有方法局限
当前领先系统普遍依赖深度传感器、LiDAR、多相机阵列或预构建地图(Zhang et al., 2025b,a; Xue et al., 2026; Chu et al., 2026),这带来显著工程瓶颈:

  • 硬件强假设提高了物料成本,并限制可适配的机器人类型;
  • 动作空间多定义在机器人本体坐标系,跨轮式、足式或飞行器部署时需重新标定;
  • 训练数据依赖真实世界采集,难以低成本大规模扩展;
  • 逐帧训练方式产生大量冗余计算,一次完整训练常需数月。

难点与重要性
仅靠单目 RGB 图像完成导航极具挑战:模型须从二维视图推断三维空间结构、解析复杂指令并规划可行路径,这要求视觉-语言对齐、长程规划和鲁棒探索。同时,策略须对相机内参和场景尺度保持不敏感,才能实现同一模型跨机器人形态直接迁移。从工程角度看,以最低传感器要求实现通用导航,可大幅降低服务机器人、无人机等产品的落地门槛,使大规模部署成为可能。

行业类比
类似自动驾驶从多传感器融合向纯视觉端到端方案的演进,该工作以“仅用单目 RGB,在图像空间指向”的思路,为具身智能提供了一种硬件解耦、高效可扩展的导航范式。

核心洞察

  • 图像空间指向(pointing)作为跨机器人泛化的关键:该方法直接在像素空间预测下一个目标点,完全脱离机器人底盘坐标系和相机内参,使同一策略无需重校准即可部署在轮式、腿足和空中机器人上。与现有方法依赖精确的机器人标定或特定动作空间不同,这种与硬件解耦的设计极大降低了规模化部署的工程门槛,从视觉感知层面实现了真正的形态无关导航。
  • 高效训练配方让8B VLM导航模型训练时间从数月缩至数天:通过prefix-caching将完整轨迹打包成单一序列,再配合树形注意力掩码防止窥视未来真实动作,训练token量减少22倍,同时强迫模型基于当前视觉输入进行动作预测。这一策略打破了视觉语言导航模型训练算力需求过高的瓶颈,使得在消费级GPU集群上也能端到端训练大模型,并让在线RL微调变得可行,进一步提升探索与错误恢复能力。
  • 单目RGB性能反超深度/多相机系统,验证了纯视觉导航的上限:尽管仅使用单目RGB流,Robostral Navigate在R2R-CE上达到77.4%成功率,比最强深度或多相机系统高出5.3个百分点。这颠覆了追求多传感器融合的主流思路,表明通过更好的训练信号和模型架构,廉价传感器可以提取出足够的环境理解,为成本敏感的机器人量产与多场景推广提供了有力证据。

方法

输入与任务建模

系统接收单目RGB图像流自然语言指令,不依赖深度传感器或预建地图。模型将导航视为序列决策问题,在图像空间直接预测目标指向点(pointing target)作为下一路径点。

模型架构与动作空间

基于8B参数的视觉语言模型,以自回归方式处理连续帧。动作表示为当前相机视图中的像素坐标,模型输出指向位置,并可选地融合位移fallback机制处理目标不在视野内的情况。这种纯图像空间操作使策略对相机内参和场景尺度鲁棒,便于跨平台(轮式、腿式、飞行)部署,无需重新标定。

关键训练技术

  • 大规模模拟数据生成:在350k个仿真场景中生成240万条导航轨迹,大幅减少真实数据采集需求。
  • 前缀缓存与序列打包:将完整episode合并为单一训练序列,通过缓存前缀中间表示避免重复前向计算,训练token消耗降低22倍,训练时间从数月缩短至数天。
  • 树注意力掩码:监督训练时施加树状注意力掩码,防止模型接触未来真实动作,减轻曝光偏差,迫使模型基于视觉观察独立预测动作。
  • 在线强化学习微调:采用CISPO算法(Constrained Iterative Sparse Policy Optimization)进行在线RL,增强探索与错误恢复能力。

与同类方法的差异

主流方法通常需要深度传感器、多相机或预构建地图才能达到高性能,而Robostral Navigate仅凭单目RGB且在图像空间预测指向,在R2R-CE和RxR-CE上不仅超越所有单目基线,更优于最强的深度/多相机方案,展示了极简传感器配置下的优越性和高效训练范式。

实验

实验设计

Habitat 仿真中生成 240 万条导航轨迹(覆盖 35 万个场景),通过 prefix-caching 监督训练将整个 episode 打包为单个序列,减少 22× token 使用。用 tree-based attention mask 防止模型依赖历史 ground-truth 动作,鼓励视觉定位。最后用 CISPO 在线强化学习提升探索与恢复能力。评估在 R2R-CERxR-CE 两个连续环境 VLN 基准上。

关键发现

  • 只用单目 RGB 图片,R2R-CE 成功率达到 77.4%,比最强单目方法高 10.5 个百分点,比任何使用深度或多相机系统高 5.3 个百分点
  • RxR-CE 成功率 75.1%,全面超越所有单目基线。
  • 模型在图像空间直接预测指向点,对相机内参和场景尺度变化鲁棒,可零样本迁移到轮式、腿式和飞行机器人。
  • 训练效率:prefix-caching 将训练时间从数月缩短到几天。

对比解读

Robostral Navigate 仅凭单目 RGB 就全面超越先前依赖深度、LiDAR 或多相机的最强系统,这打破了“传感器越多性能越好”的惯性思维。其在 R2R-CE 上对单目方法的 10.5 点提升说明,视觉语言模型的 scaling 和训练策略(prefix-caching + tree-attention + RL)能够充分提取单目视频流中的几何与语义线索。与深度方法比较,它不需校准或重建,大幅降低硬件成本和部署复杂度,为低成本、跨具身的大规模机器人导航打开了新空间。

行业影响

落地场景

Robostral Navigate 仅依赖单目 RGB 图像的视觉语言导航能力,可直接嵌入三类产品:仓储物流机器人在无预先建图的动态货架间按指令拣选;家用/商用服务机器人(如酒店递送、展馆引导)利用现有摄像头硬件实现自然语言指令跟随;巡检无人机在无 GPS 的地下或室内环境中依据语言描述路线自主巡查。此外,辅助驾驶系统可在低配硬件上实现“找车位”“跟车”等语义级导航。

商业价值

核心降本点来自传感器简化与去校准:从深度相机/LiDAR/多目方案缩减为单目 RGB,硬件成本可降低 40%–70%,且部署时无需对外参、内参进行机器人特定标定,显著压缩现场调试人力。同时,跨轮式、足式、空中机器人零样本泛化,使同一模型可覆盖多条产品线,降低维护与再训练投入。在体验上,纯图像空间动作预测对场景尺度变化鲁棒,能提升长尾场景下的任务成功率,直接转化为客户侧更稳定的自动化运行时长。

与现有产品/工作流的接口

模型输出为图像空间的指向动作(pointing)与位移回退,本质是2D 像素坐标,可极轻量集成进现有导航栈:上层接收语言指令与图像帧,输出目标点,再通过深度估计或投影关系转为本地坐标系下的相对位姿,交给经典规划器(如 TEB、DWA)执行。训练侧的 prefix-caching 与树注意力掩码可被封装为可复用的训练框架,用于其他具身决策模型的效率优化。RL 微调阶段可与 ROS/Gazebo/Isaac Sim 等仿真器对接,形成“仿真训练-实机部署”闭环。

具体落地 Use Case

  • 电商仓库 AMR 拣货:工作人员通过自然语言(“去 A3 货架取中型纸箱,然后送到 2 号打包台”)下达任务,机器人仅依靠前视 RGB 摄像头按指令分步导航,无需铺设磁条或部署反光板,大幅降低仓库改造费用与换季换线成本。
  • 数据中心巡检无人机:在无 GPS 的地下机房,管理员描述“沿冷通道第 3 排机柜巡视,检查指示灯状态”,无人机基于单目图像流按视觉线索逐点移动,避免昂贵的激光 SLAM 系统,且跨不同层高、机柜布局的泛化不需要重新调参。

局限

  • **缺少真实世界实验验证**:论文的所有训练和评估均在模拟环境(Habitat)中完成,虽然单目 RGB 输入简化了硬件要求,但从模拟到真实(sim‑to‑real)的泛化能力未经验证。真实场景中的光照变化、动态障碍物、纹理差异和传感器噪声可能导致模型性能显著下降,且文中未给出任何真实机器人实验结果,限制了其在现实部署中的可靠性。
  • **纯视觉感知缺乏安全层**:模型仅依赖单目 RGB 图像预测像素级航点,不依赖深度信息或环境地图,这在简化部署的同时丢弃了 3D 结构信息。对于需要精细深度判断的场景(如狭窄过道、楼梯、透明障碍物),该方法可能无法做出安全合理的决策,且缺少显式的避障机制,在动态环境中存在碰撞风险。
  • **模型规模限制边缘部署**:使用 8B 参数的视觉语言模型进行端到端推理,需要 GPU 级别的计算资源,难以直接部署在算力有限的嵌入式平台或低功耗机器人上。虽然训练效率高,但推理时的内存和功耗开销可能成为实际推广的瓶颈,尤其是对于要求高频控制或电池供电的移动平台。
论文Arjun Majumdar2026-07-22原文

相关内容