AgentVLN:用 3B 视觉语言模型做机器人导航,被 ECCV 2026 录用
让 VLM 当大脑、技能库当手脚的分层导航框架,把 3D 路径规划转成 VLM 更擅长的 2D 图像选点,3B 模型就能端侧跑。
视觉语言模型能看懂图片,却难把一句"穿过走廊,在窗户旁找椅子"变成机器人的连续动作。AgentVLN 提出 VLM-as-Brain 思路:VLM 只负责理解任务和调度技能,建图、避障、定位交给插件式技能模块,在 R2R-CE、RxR-CE 基准上领先,且 3B 模型可在 Jetson 等边缘设备实时运行。
正文摘录
.jpg)  近年来,视觉语言模型(Vision-Language Model, VLM)在图像理解、语义推理等任务中展现出了强大的能力。然而,当这些模型真正进入物理世界,让机器人根据一句自然语言指令完成自主导航时,仍然面临巨大挑战。 例如,机器人完成一句简单的指令: “穿过走廊,在窗户旁边找到椅子。” 机器人不仅需要 “理解” 这句话,还需要知道:“走廊在哪里? 窗户和椅子之间是什么空间关系?当前视角是否被遮挡?应该先往哪里移动?接近目标时如何避免碰撞?” 这就是视觉语言导航(Vision-and-Language Navigation, VLN)面临的核心问题:如何让智能体将自然语言指令转化为现实世界中的连续行动。 为此,AgentVLN 提出 “VLM-as-Brain” 的理念,让 VLM 负责高层认知决策,同时通过模块化技能库完成具体执行,从而实现更加高效、灵活的机器人导航,即:VLM Agent → Skill Calling → SLAM/Perception → Robot Navigation。