论文

将基础模型 Scaffolding 为物理世界智能体,推动长视距导航前沿

将基础模型 Scaffolding 为物理世界智能体,推动长视距导航前沿

长视距物理世界智能体必须在远距离目标上推理,同时将决策基于可靠的闭环行为。当前基础模型将这些能力割裂:视觉语言模型(VLM) 能推断缺失信息并调整高层计划,但在重复导航 grounding 上脆弱且低效;导航基础模型(NFM) 能稳健执行语义目标,但仅作为有界情节运行,缺乏持久任务级推理。 我们提出 NavMCP,一个智能体脚手架框架,将 VLM 推理智能体与 NFM 执行器耦合用于长视距探索。VLM 决定寻求什么证据、去哪里搜索、何时停止,而 NFM 将每个语义子目标 grounding 为闭环导航。三个通道结构化它们的协作:intent 将证据需求转化为导航调用,observation 将轨迹转换为源 grounded 的轨迹证据,memory 累积发现、负面证据和未解决目标。 该设计在不重训练任一模型的情况下,将孤立导航轨迹转变为持久具身交互。在具身问答上,NavMCP 在 HM-EQA、MT-HM3D 和 EXPRESS-Bench 上取得最先进结果。在匹配智能体和执行器主干下,它在 HM-EQA 上优于情节式接口 14.9 个百分点。在 Unitree Go2 上,NavMCP 达到 78.3% 成功率,其相对于最强基线的优势随任务视距增加从 10 点增长到 45 点。这些结果证明了将互补基础模型 scaffolding 为长视距物理世界智能体的潜力。

论文精读

TL;DR NavMCP 通过意图、观察、记忆三通道把 VLM 推理智能体与导航基础模型执行器组合起来,无需重训练即可显著提升长程具身问答成功率,真实机器人达 78.3%。

问题

问题背景

长期物理世界智能体需要同时具备高层语义推理与可靠闭环执行能力,这是 Embodied AI 当前的核心关注点。

现有方法局限

  • Vision-Language Model (VLM) 能推断缺失信息、动态调整计划,但将其决策反复落地为导航动作时脆且低效:每步视觉-语言推理开销大,缺乏底层运动先验,在长距离探索中容易漂移。
  • Navigation Foundation Model (NFM) 擅长将语义目标转化为稳定的闭环导航,但本质是有界回合(bounded episode),缺少跨回合的任务级记忆与主动信息收集策略,无法自行决定“找什么证据、去哪里找、何时停止”。 两者割裂导致在 Embodied Question Answering 这类多步依赖任务中,上层推理脱离可靠执行,或执行器只会机械完成单条指令,整体成功率随任务长度快速下降。

为什么这个问题难/重要

技术难点在于跨模型、跨时间尺度的协作:高层模型输出的意图需被转换为可执行、可验证的导航调用;低层轨迹必须被压缩为可溯源的证据 反馈给高层;同时还要累积正/负证据、未解决目标,避免上下文爆炸。业界关注度来自真实机器人、数字孪生与 AR/VR 导航对长程自主交互的迫切需求——单纯扩大单一模型无法同时解决稳定性、成本与可解释性问题。

行业类比

类似用 LLM Agent 编排检索工具 的长程问答系统:检索器负责精确召回片段,LLM 负责选择查询、综合证据、判断终止;缺少任何一侧,任务成功率都会随问题复杂度增加而急剧下滑。

核心洞察

  • NavMCP 的核心是将 VLM 的长程推理能力与 NFM 的闭环导航执行能力通过 **意图-观察-记忆** 三通道协议解耦并协同,在不重新训练任何模型的前提下构建物理世界长程 agent。与以往工具增强或端到端训练不同,该框架将高层规划与底层执行明确分离,用结构化协议传递证据需求、轨迹观察和累积记忆,避免了 VLM 直接生成导航动作的脆弱性和 NFM 缺乏任务级推理的局限。这种 scaffolding 思路更贴近实际部署,既保留各模型专长,又通过持久交互扩展能力边界。
  • NavMCP 的贡献在于把单次导航 `rollout` 转化为持久的 embodied 证据累积过程,通过 `memory` 通道维护研究发现、负面证据和未解决目标,实现跨调用的状态连续性。传统 NFM 是 `episodic` 接口,每次调用独立,无法追踪长程任务中的部分进展和失败信息。NavMCP 通过 VLM 仲裁记忆,动态决定搜索和停止,显著缩小了 `episodic` 接口的性能差距(HM-EQA 上提升 14.9 个百分点),并在真实机器人上随 horizon 增长优势扩大到 45 个百分点,证明记忆机制是长程任务关键。

方法

输入 → 关键模块 → 输出

NavMCP 接收 长时程具身任务 的输入,例如 Embodied Question Answering(EQA)中的自然语言问题与当前 RGB-D 观测,或真实机器人上的探索指令。系统由两个互补的 foundation model 组成:VLM 推理智能体 与 NFM 导航执行器。VLM 负责高层规划与证据需求推理:它决定 需要寻找什么证据、去哪里搜索、何时停止;NFM 则将每个语义子目标转化为闭环导航动作序列。

三个协作通道

  1. Intent 通道:VLM 将当前的证据缺口翻译为结构化的导航调用(如 navigate_to("kitchen")),发送给 NFM。
  2. Observation 通道:NFM 执行导航后,其 rollout 轨迹被采样并压缩为源接地的轨迹证据,返回给 VLM,避免直接回放原始视频帧造成上下文爆炸。
  3. Memory 通道:跨多次调用累积三类信息——已找到的正面证据、负面证据(确认某区域不存在目标)、仍未解决的子目标,形成持久化的 EQA 上下文状态。

整体流程:VLM 通过 Memory 判断当前信息是否足够;若不足,则通过 Intent 发起下一次导航;NFM 执行后,Observation 把结果写回 Memory;循环直到 VLM 判定可以输出答案或任务完成。

工程差异

与典型的 tool-augmented agent(每次调用返回原始工具输出后即丢弃)不同,NavMCP 在 不重训练任何模型 的前提下,通过上述三个结构化通道把孤立的导航 rollout 转化为持续具身交互,从而在 HM-EQA、MT-HM3D 等基准上超越 episodic interface 基线。

实验

实验设计

NavMCP 在三个具身问答基准上评估:HM-EQA、MT-HM3D、EXPRESS-Bench,并与 episodic interface 等基线对比。同时,在 Unitree Go2 四足机器人上进行真实世界实验,测试不同任务 horizon 下的成功率。方法上,VLM 推理 agent 通过 intent / observation / memory 三个通道与 NFM 执行器协作,整个过程不重训练任何模型。

关键发现

  • 在 HM-EQA 上,NavMCP 比 episodic interface 高出 14.9 个百分点,并在三个基准上取得 state-of-the-art。
  • 在真实机器人实验中,NavMCP 达到 78.3% 成功率;且随着任务 horizon 增加,相对最强基线的优势从 10 个百分点 扩大到 45 个百分点。

对比与工程启示

  • 与 episodic interface 的差异:episodic 将每个子目标视为独立导航片段,缺乏跨调用的任务记忆;NavMCP 的 memory 通道累积证据、负结果和未解决目标,把零散 rollout 转化为持续具身交互。
  • 工程意义:无需重训练即可将互补的 VLM 与 NFM 组合成长时程 agent,降低部署成本,也提示未来可在 scaffolding 层继续优化上下文管理与 evidence 仲裁。

行业影响

落地场景

NavMCP 的 VLM + NFM 脚手架架构适合需要长期自主探索与语义理解的物理世界任务,典型产品形态包括:

  • 仓储与物流机器人:在大型仓库中执行“找到某个特定 SKU 并汇报位置”任务,机器人可分批探测货架、记录未命中区域,避免重复搜索。
  • 智能安防巡检:楼宇或园区机器人根据自然语言指令(如“检查三楼东侧走廊是否有异常”),自主规划多段导航并采集视觉证据。
  • 消费级服务机器人:家庭陪伴机器人执行“找到电视遥控器在哪”类开放式问答,利用记忆通道累积多轮搜索线索。

商业价值

核心收益来自 长任务完成率提升带来的劳动力替代与效率优化。

  • 降本:减少人工远程操控或重新部署导航模型的需求,一次部署可覆盖多类开放式探索任务。
  • 增收:让机器人具备回答“物件在哪 / 环境状态如何”等企业级查询能力,可打包为 SaaS 或机器人订阅服务。
  • 体验提升:用户无需预定义导航目标,机器人自主推理“去哪找、什么时候停”,交互自然度显著提高。

与现有产品/工作流的接口

NavMCP 不要求重训 VLM 或 NFM,因此可作为 中间件层 接入现有机器人软件栈:

  • 上游对接任意支持 function calling 的 VLM(如 GPT-4V、Qwen-VL),下游封装任意闭环导航模型(如 GOAT、L3MVN)。
  • 三个通道 intent / observation / memory 可通过标准 API 实现,方便替换底层模型或适配新工具。
  • 与现有任务规划框架(如 LangChain、ROS 2 行为树)兼容,可插入为“长程探索”行为节点。

具体落地用例

  1. 电商仓储:机器人接到“确认 A 区是否有缺货的某种饮料”指令,自主遍历货架、拍摄货位图像,最终返回“未找到,但 B 区有相似包装”的证据链,减少人工盘点时间。
  2. 企业设施管理:写字楼服务机器人执行“找出所有灭火器位置并报告压力表状态”,通过记忆通道记录已检查楼层,避免重复路径,输出结构化巡检报告。

局限

  • **模型依赖与通信开销**:NavMCP 将 VLM 推理与 NFM 闭环导航解耦,但系统性能受限于底层 NFM 的语义导航能力,若 NFM 在未知障碍或罕见物体上失效,上层 VLM 无法直接纠正底层错误;同时每次证据获取需要完整导航 rollout,带来较高步数与时间开销,相比端到端模型或 episodic 接口在短任务上不一定有优势。
  • **记忆管理与泛化边界**:memory channel 长期累积证据,但 VLM 上下文窗口有限,压缩策略可能丢失关键空间关系或否定证据,影响长时程推理一致性;此外当前实验集中在 Embodied Question Answering 基准,缺少对更广泛物理交互任务(如操作、导航到物体并交互)的验证,框架泛化性仍需进一步探索。
  • **与同类工作的对比弱点**:与端到端具身大模型(如 RT-2、OpenVLA)或单模型多任务导航器相比,NavMCP 需要同时部署 VLM 与 NFM,并维护 intent、observation、memory 三通道协议,工程复杂度和系统脆弱性更高;其创新主要在于系统编排而非底层算法,若后续 NFM 能力大幅提升或端到端模型成熟,该框架的增量价值可能被压缩。
论文Zixing Lei2026-08-31原文

相关内容