ABot-N1:迈向通用视觉语言导航基础模型
视觉语言导航基础模型旨在统一深层推理的立足空间决策与广泛多功能性,以应对多样化的具身任务。现有方法通常通过将观测直接映射到动作的单一策略实现这一集成,但常受坐标漂移和长尾语义处理不佳的困扰。此外,这些黑盒映射缺乏可解释性,阻碍了通用性、鲁棒性和透明性的同步实现。 我们提出ABot-N1,朝着通用视觉语言导航基础模型迈出一步,通过慢-快架构引导的双视觉-语言信号将认知与控制解耦。具体而言,慢速视觉语言推理器执行显式思维链推理,同时生成像素目标。这一紧凑的图像空间锚点集作为通用接口,适用于多种任务,包括点目标、对象目标、兴趣点目标、指令跟随和人物跟随。随后,快速动作专家利用文本线索和像素引导,以原生控制频率生成连续航点。通过像素接地锚点结合显式语言痕迹桥接高级意图与低级控制,我们的方法在仿真和真实世界基准中确保了鲁棒、可泛化且可解释的导航。 ABot-N1建立了新的最先进纪录,尤其在城市级导航中取得巨大提升:将兴趣点到达率提升35.0%(至77.3%),并在复杂室内外场景中达到95.4%/92.9%的成功率。它还在物体到达、人物跟随和指令跟随任务中保持卓越鲁棒性。新的点目标/兴趣点目标基准已开源,以推动城市级导航领域发展。
论文精读
TL;DR ABot-N1 提出“慢思考—快行动”双系统架构,通过 Chain-of-Thought 推理生成像素锚点统一多种导航任务,在城市场景 POI 到达等指标上大幅刷新 SOTA,兼具强鲁棒性与可解释性。
问题
问题背景
视觉语言导航(VLN)基础模型旨在将深度空间推理与多样具身任务相结合,实现通用、可泛化的自主导航能力。然而,当前主流方案多采用单片式策略(monolithic policies) ,直接从观测映射到动作,面临坐标漂移与长尾语义处理不佳等瓶颈,且黑箱式决策缺乏可解释性,阻碍了通用性、鲁棒性和透明度的同步提升。
现有方法局限
- 单一片式架构:缺乏显式的认知解耦,高层推理与低层控制纠缠在一起,导致模型难以应对环境中的长尾物体或复杂语义。
- 坐标漂移问题:由于未将视觉感知与空间坐标显式关联,长时间导航下累计误差显著,尤其在城市场景中容易迷失。
- 任务特异性强:针对点目标、物体目标、指令跟随等多种任务,需要独立设计策略,无法实现统一的跨任务泛化。
- 可解释性缺失:端到端黑箱映射使错误决策难以追溯,不利于调试与安全部署。
为何困难且重要
具身导航本质上要求高层语义推理与低层连续控制的深度协同,且任务类型(点目标、物体目标、指令跟随、行人跟随等)对空间理解、语言解析和行动输出格式的要求差异极大。统一这些能力不仅需要解决多模态对齐的挑战,还要在保持模型效率的同时实现实时控制。业界对服务机器人、自动驾驶等应用有着迫切需求,一款可解释、鲁棒且通用的导航基座模型能显著降低部署门槛,加速具身智能落地。
行业类比
这如同大型语言模型从特定任务微调走向通用基座模型的演进,但具身导航还需叠加物理世界的实时感知-行动闭环,难度更甚。
核心洞察
- **慢-快双系统解耦架构**:将导航拆分为执行显式思维链推理的慢速视觉语言推理器和生成连续航点的快速行动专家。这打破了主流端到端黑盒方案,通过像素级锚点作为通用接口,既保留了可解释的推理链条,又将高级意图与低级控制解耦,避免了坐标漂移和长尾语义处理困难,从而在复杂城市环境中实现鲁棒泛化。
- **像素目标作为通用任务表征**:用图像空间内的少量锚点(pixel goal)统一表达点目标、对象目标、POI目标、指令跟随、人员跟随等异构任务。与为每类任务设计独立输出或策略的常见做法不同,这一紧致表示使得单一模型即可通过共享的像素级指导完成多种导航任务,大幅简化了多任务基础模型的训练与部署,并带来了跨任务的显著性能提升(如POI到达率提升35个百分点)。
方法
输入与任务统一
ABot-N1 接收 RGB 图像 和 语言指令(如目标描述、指令文本),将 五种导航任务 统一为相同的接口:点目标、物体目标、POI 目标、指令跟随、行人跟随。语言指令经过 tokenization,视觉输入经 ViT 编码为特征序列。
慢速推理器:认知解耦与像素锚点
慢速系统由一个 Vision-Language Model (VLM) 构成,执行 显式 Chain-of-Thought 推理。推理过程生成两路输出:
- 文本思维链:描述空间关系、目标语义和路径规划;
- 像素目标 (pixel goal):在图像空间中预测一组稀疏的 锚点坐标,作为下游控制的通用接口。 这种设计将高层语义理解与底层运动控制解耦,使推理器专注于长距离规划和罕见语义处理。
快速行动专家:从锚点到航点
快速系统是轻量的 动作专家网络,以原始控制频率运行。它接收:
- 慢速系统产生的 像素锚点 与 文本线索;
- 连续视觉帧的局部特征。 通过 航点解码器 逐步生成连续空间中的 waypoints,再转换为机器人可执行的速度指令。该模块利用像素锚点作为显式正则,有效克服传统端到端策略的坐标漂移问题。
异步推理与训练策略
- 异步推理:慢速系统仅在需要重新规划时调用(如遇到障碍或语义变化),快速系统持续输出航点,保证实时性。
- 预训练:在混合多任务数据上进行监督学习,迫使模型学习共享的视觉-语言-空间先验。
- 后训练微调:采用 GRPO (Group Relative Policy Optimization) 强化学习,设计包含格式、目标对齐和安全间距的奖励函数,通过平衡采样方式提升不同任务下的泛化性。
与同类方法的差异
相比直接映射观测到动作的 单体式黑盒策略,ABot-N1 通过慢快解耦和像素锚点接口,将推理过程显式化,从而提供可解释的决策链,并在长尾语义和城市级大场景中显著提升鲁棒性与泛化能力。
实验
实验设计
ABot-N1 在五个任务上进行了评估:指令跟随(VLN-CE R2R/RxR)、目标点(ABotN-PointBench)、兴趣点(ABotN-POIBench)、物体目标(OVON)和人员跟随(EVT-Bench)。模拟评估覆盖复杂室内外场景,并新增了 ABotN-PointBench 和 ABotN-POIBench 两个城市级导航基准,开源供社区使用。此外,在真实机器人上进行了部署验证,包括边缘设备部署方案。
关键发现
- 慢-快架构有效解耦认知与控制,提升鲁棒性和可解释性。
- 像素目标作为通用接口,统一多种导航任务,避免坐标漂移。
- 在城市级导航中,POI 到达率提升 35.0% 至 77.3%,室内和室外成功率分别达 95.4% 和 92.9%,刷新多项 SOTA。
- 真实世界部署验证了方法的泛化性和实用性。
基线对比解读
与以往单体策略(monolithic policies)相比,ABot-N1 通过显式思维链和像素目标,显著改善了对长尾语义的处理,并降低了累积误差。在 POI-Goal 任务上,相比之前方法大幅领先,可能源于慢系统对空间关系的深层推理。同时,解耦设计使快速动作专家能独立优化控制精度,而慢系统专注于高层意图,实现了一般性与鲁棒性的平衡。此外,提供语言轨迹增强了可解释性,有利于调试与信任建立。
行业影响
落地场景
ABot-N1 的慢-快解耦架构与像素目标锚点,可直接赋能需要鲁棒空间推理与通用导航能力的具身智能产品:
- 服务机器人(商场导引、酒店配送、家庭助理)处理自然语言指令,动态切换任务(如从“带我去最近的咖啡店”到“跟着那个人”)。
- 仓储与物流自动化:AGV/AMR 通过语言指令灵活调整分拣路径,并在动态环境中避障。
- 自动驾驶与高级辅助驾驶(ADAS):城市级 POI 导航、停车场寻车、施工区语义理解,利用显式思维链提升可解释性。
- AR/VR 导航:在室内外混合场景中为视障人士或游客提供“像素级”指引。
商业价值
- 降本:单一模型替代多任务专用导航堆栈,减少感知-规划-控制模块的定制开发与维护成本;POI 到达率提升 35% 意味着在配送、巡检等场景中显著减少人工干预。
- 增收:通用导航能力使机器人可快速适配新场景(如新商场、新仓库),缩短部署周期,扩大服务覆盖;AR 导航可成为地图、旅游等应用的增值功能。
- 体验提升:自然语言指令直接控车/控机器人,降低使用门槛;显式思维链+像素目标提供可解释的决策过程,增强用户信任与安全审核能力。
与现有产品/工作流的接口
模型可作为 ROS 2 导航节点或边缘推理服务集成:
- 输入:摄像头流 + 文本指令(或目标类别/POI ID)。
- 输出:连续航点序列,可直接驱动底层控制器(DWA、MPPI)。
- 训练数据:利用现有导航日志、仿真数据,通过项目提供的开源基准(ABotN-PointBench、POIBench)微调。
- 硬件:支持 NVIDIA Jetson 等边缘设备,便于商用机器人快速搭载。
- 与 RAG/地图服务协作:POI 导航可结合实时地图 API 更新锚点语义,适应动态环境。
具体落地 Use Case
- 电商仓储拣选机器人:工人通过语音说“到库存区 B-3 拿蓝色包装盒”,模型将指令分解为路径点并驱动机械臂底盘运动,同时利用人员跟随能力协助工人搬运重物,提升拣选效率。
- 城市共享出行平台:在最后一公里导航场景中,乘客App 输入“找到写着‘北门’的柱子”,车辆利用指令跟随与POI 导航进行厘米级精确定位,解决 GPS 漂移问题;可解释的推理链还能向乘客反馈“正在寻找蓝色指示牌”,增强交互体验。
局限
- **视觉条件鲁棒性有限**:ABot-N1 将像素目标(image-space anchor points)作为所有任务的通用接口,强依赖于视觉输入的清晰与稳定。在低光照、部分遮挡、运动模糊或传感器噪声严重的场景下,慢速推理器可能输出不精确甚至错误的像素锚点,导致快速执行器生成的轨迹偏离正确路径。相比基于显式坐标或语义地图的方法,这种紧耦合于原始像素的表示更容易受到图像退化影响,对硬件成像质量要求更高,在长时间跨度的城市场景中可能累积定位误差。
- **异步推理延迟对动态避障的制约**:该系统采用慢-快异步架构,慢速系统进行链式思维推理并生成像素目标,这一过程可能引入不可忽略的推理时间(文中未给出具体延迟指标)。在动态环境中(如移动行人、车辆),若快速执行器基于过时的像素目标连续输出航点,可能无法及时响应突发障碍,导致碰撞或路径振荡。对于需要高频重规划的任务(如 person-following),这种延迟-实时性的折衷可能成为瓶颈,限制了其在高度交互的室外场景中的应用。
- **跨域泛化与长尾语义的挑战未充分解决**:虽然 ABot-N1 在一系列仿真和真实世界基准上取得了领先结果,但其训练和微调数据(尤其是城市场景)可能集中于特定地理区域和道路结构。对于截然不同的城市拓扑、交通规则、建筑风格乃至文化相关的视觉 cue(如非拉丁文字标识),模型的迁移能力尚待验证。此外,论文虽承认现有方法对长尾语义处理不佳,但 ABot-N1 将语义理解完全交由 VLM 推理器,VLM 本身的幻觉或对稀有指令(如“找到第三棵松树旁的红色邮箱”)的理解短板可能依然存在,并未在复杂长尾指令上做专门消融。