MobileVLA-R1 2.0:面向移动机器人控制的 RL 增强推理
问题 :将自然语言指令落地为可靠且可执行的行动,对移动机器人上的 vision-language-action(VLA) 系统始终是一项基础性挑战,根源在于高层语义推理与底层移动及操作控制之间长期存在的鸿沟。现有方法多依赖隐式推理或单体式动作预测,难以在保持长时程决策连贯性的同时生成精确且具适应性的机器人动作。 方法 :我们提出 MobileVLA-R1 2.0 ,一个 RL 增强的 VLA 框架,显式地将结构化具身推理与可执行的移动机器人控制耦合起来。框架通过监督式 Chain-of-Thought(CoT) 对齐与强化学习,在具身轨迹上学习多粒度推理,超越纯行为监督以提升「推理—行动」一致性。为同时支持移动与操作,我们进一步引入 reasoning-conditioned action decoder ,将多模态推理表征映射为任务级动作目标,再由机器人控制器翻译为具体本体的指令。该设计提供统一的感知—推理—行动接口,并将高层动作生成与机器人特定驱动解耦。 实验 :我们在语言引导导航、四足控制与人类oid移动操作上开展广泛评估,覆盖 VLN-CE、QUARD 以及 Unitree Go2 与 G1 机器人的真实部署。 结果:相比 MobileVLA-R1,MobileVLA-R1 2.0 在 VLN-CE 上 SR 平均提升 1.6 点,在真实 G1 移动操作任务上全任务成功率提升 10.0 点,并持续优于强 VLA 基线,展现出稳健的长时程指令跟随与跨平台闭环执行能力。
论文精读
TL;DR MobileVLA-R1 2.0 将结构化思维链推理与移动机器人动作解码显式耦合,通过 RL 优化推理到动作一致性,统一导航、四足与双足操控。
问题
问题背景
具身智能与 VLA(Vision-Language-Action)系统正从固定场景操作走向移动机器人,核心目标是将自然语言指令可靠转化为可执行动作。
现有方法局限
- 多数 VLA 模型采用隐式推理或端到端单步动作预测,高层语义规划与低层运动控制耦合在同一黑盒中,导致长程任务中决策连贯性差、动作精度不足。
- 监督学习仅对齐行为克隆,缺乏对推理链的显式约束,模型容易在未见环境中产生“推理正确但动作错误”的不一致。
- 动作输出通常是机器人本体相关的连续控制量,与高层任务目标解耦,难以跨平台迁移;单一模型覆盖导航、四足运动、人形操作时能力割裂。
为什么难/重要
移动机器人任务需同时处理多模态感知(视觉、语言、本体状态)、长时程规划和实时闭环执行,且不同机器人平台的动作空间差异巨大。业界对通用机器人基础模型的关注持续升温,但推理到动作的一致性和跨 embodiment 泛化仍是落地瓶颈。
行业类比
类似大语言模型中 Chain-of-Thought 从“直接回答”进化到“先推理后行动”,VLA 也需要显式推理作为中间层,才能像 LLM 调用工具那样将高层意图稳定映射到低层控制。
核心洞察
- 显式将推理过程作为动作解码的条件输入,而非仅作为训练时的辅助监督信号。与现有 VLA 中隐式推理或直接端到端预测动作不同,该框架通过监督 CoT 对齐与 GRPO 强化学习,直接优化推理结果与生成动作之间的一致性,从根本上缓解长程任务中推理与执行脱节的问题,从而提升指令跟随的成功率与鲁棒性。
- 通过推理条件化解码器将任务级动作目标与机器人本体控制解耦。该设计输出高层语义目标(如导航点、抓取位姿),再由底层控制器转换为具体关节指令,使得同一推理模型可跨多形态平台(四足 Go2、人形 G1)复用,显著降低数据收集与训练成本,同时保持闭环执行能力,与整体端到端动作预测形成清晰对比。
方法
MobileVLA-R1 2.0 遵循“感知 → 推理 → 动作”的显式分层架构,输入为自然语言指令与多视角视觉观测,输出为机器人可执行的动作命令。
多模态推理骨干
框架采用视觉-语言模型作为推理骨干,接收指令与视觉序列,通过监督 Chain-of-Thought (CoT) 对齐生成结构化的多粒度推理,涵盖高层任务分解、空间定位、步骤规划及状态判断。推理过程以文本 token 序列显式表示,捕获长期依赖。
Reasoning-Conditioned Action Decoder
推理条件动作解码器 将多模态推理表示映射为任务级动作目标,例如导航子目标点或末端执行器位姿,而非直接输出底层电机信号。这种解耦使同一推理模块可适配不同机器人平台。
机器人控制器
任务级动作目标随后送入各平台自带的控制器(如 Unitree Go2 的四足运动控制、G1 的全身控制),转换为关节力矩或速度命令,实现闭环执行。
训练分为两阶段:先使用监督学习对 CoT 和动作目标进行行为克隆对齐,随后采用 GRPO 强化学习进一步优化推理到动作的一致性,奖励信号以任务成功率和轨迹效率为准,超越纯行为监督。
与同类 VLA 方法相比,MobileVLA-R1 2.0 的关键差异在于显式分离高层推理与低层执行,并通过 RL 针对性优化推理-动作对齐,而非将推理隐式融入单体动作预测。
实验
实验设计
在 VLN-CE(视觉语言导航-连续环境)、QUARD(四足控制)以及真实世界 Unitree Go2/G1 机器人上开展评估,覆盖语言引导导航、四足控制和仿人移动操作。对比对象包括强 VLA 基线,重点考察 SR(成功率)与 full-task success。模型以 MobileVLA-R1 为直接对照,验证 RL 增强推理对动作解码的增益。
关键发现
- 在 VLN-CE 上,MobileVLA-R1 2.0 的平均 SR 提升 1.6 点;在真实世界 G1 移动操作任务上,full-task success 提升 10.0 点。
- 长程指令遵循与闭环执行在不同机器人平台上表现稳健,显示推理-动作一致性优于纯行为监督。
与基线对比解读
相对 MobileVLA-R1,2.0 显式引入 CoT 对齐与 GRPO 推理优化,将高层动作生成与机器人特定驱动解耦。这解释了成功率提升:模型不再依赖隐式推理或整体动作预测,而是先产出多粒度推理表示,再通过 reasoning-conditioned action decoder 映射到任务级动作目标。工程启示:该解耦设计有利于跨平台迁移,降低新机器人适配成本。
行业影响
落地场景:
移动机器人 MobileVLA-R1 2.0 将结构化推理与低阶控制解耦,适用于电商仓储拣选、医院药品配送、安防巡检等长时程任务。其多粒度推理和 reasoning-conditioned action decoder 可直接生成任务级动作目标,由底层控制器执行,降低对高精度动作标注的依赖。
商业价值: RL 增强的推理一致性可提升长时程任务成功率(如报告显示 G1 真实任务成功率提升 10 点),减少人工接管频次,直接降低运营成本。跨平台部署(Unitree Go2/G1)减少不同机器人型号的适配开发,缩短产品迭代周期。
接口集成:
该框架可作为高层 perception-reasoning-action 模块,输出目标位姿/操作指令,通过 ROS 2 topic 或行为树节点对接现有运动规划与底层控制器。与现有 VLA 方案相比,其显式 CoT 推理便于调试和审计,企业可将现有 VLM 推理部分替换为该模块,无需重构运动控制栈。
具体 use case:
- 电商仓储:机器人接收“从 A 货架取蓝色周转箱,送至打包台 B”的自然语言指令,需跨区域导航、避障、抓取与放置。MobileVLA-R1 2.0 能保持长时程任务连贯性,减少因语义歧义导致的错误动作。
- 医疗物流:医院配送机器人需理解“去 3 楼药房取药,送到 5 楼护士站”,涉及电梯操作、门禁交互和走廊导航。其推理条件解码器能将高层意图映射为可执行动作序列,提升复杂动态环境下的可靠性。
局限
- - 数据标注与推理链质量:本方法依赖**多粒度推理链标注**,尽管采用 CoT 数据引擎自动生成,但推理链与真实决策的吻合度仍需人工校验,且覆盖的场景有限。与纯行为克隆相比,推理监督增加了数据构建复杂度,在未见环境或长尾指令下,推理错误可能直接导致动作偏差。此外,数据集规模与多样性限制,可能阻碍在开放世界场景中的部署。
- - RL 训练效率与稳定性:将强化学习用于推理-动作优化,需要大量环境交互,模拟器奖励设计可能与真实任务目标存在偏差。论文在模拟器和有限真实任务上验证,但 RL 训练的超参数敏感、收敛困难等问题未被深入讨论。对于移动机器人,真实世界数据采集成本高,样本效率低,可能导致 sim-to-real 差距。此外,闭环执行依赖感知模块的实时性,在动态环境中可能引入延迟。
- - 跨平台与跨任务泛化:虽然 `reasoning-conditioned action decoder` 将高层动作与低层控制解耦,但实际部署时仍需为不同机器人平台编写控制器,且目前仅在 Unitree Go2(四足)和 G1(人形)上展示。对于其他构型(如轮式、多臂)或精细操作场景,该方法是否有效尚不明确。此外,推理模块对环境感知的依赖较强,在光照变化、遮挡等条件下性能可能下降。