MM-ABC: 通过感知、协调与想象迈向通用移动操作
移动操作 让可达区域本身可控,把交互拓展到固定运动学工作空间之外,但也带来两大挑战:连续自运动下的空间接地感知,以及机械臂与底盘的异构动作协调。现有方法多以显式 3D 表示或预测式世界模型强化几何,并把移动与操作拆成独立动作流;作者认为还需要支持跨流高效协作的表示。 MM-ABC 是围绕 Seeing、Coordinating、Imagining Arm-Base Collaboration 构建的基础模型:用稀疏多层级 VLM 特征做空间感知;引入仅训练使用的未来分支,以世界想象和几何意图作为额外监督,强化感知与操作意图预测;并由 MM-APT 通过 masked joint attention 与 clean-action x-prediction 协调分离的操作与移动流。 消融显示,将 clean-action 预测替换为速度预测会让 RoboCasa365 composite-seen 成功率从 32.8% 降至 29.2%,移除未来监督或多层级条件则跌幅更大。模型在 400K+ 回合、12 个数据集、17 种本体、5000+ 小时异构机器人数据上预训练,评测覆盖 EBench、RoboCasa365、ManiSkill-HAB、LIBERO、LIBERO-Plus 与真实移动操作,成功率分别为 44.71%、61.2%、99.1% 和 82.8%,五个真实任务平均 83%。
论文精读
TL;DR MM-ABC 用稀疏多级 VLM 特征、未来几何监督和 MM-APT 双流协调训练移动操作基础模型,在多基准上取得 LIBERO 99.1%、真实任务 83% 的成功率。
问题
问题背景
移动操作 (mobile manipulation) 正成为机器人学习的关键方向,目标是将固定基座机械臂扩展至可自主移动的复合操作空间,覆盖服务、仓储等复杂场景。
现有方法局限
当前主流方案常将移动与操作解耦为两条独立动作流,通过显式 3D 表示或预测世界模型增强空间感知,但存在以下短板:
- 动作参数化 多用速度或位姿增量,噪声大且难以学习,导致策略在长程复合任务中成功率低(如 RoboCasa365 上从 32.8% 降至 29.2%)。
- 缺乏跨流协作机制,臂-基座动作各自为政,无法共享几何意图与未来信息。
- 感知层仅依赖单一层级 VLM 特征,忽略多尺度空间上下文,连续自运动下定位漂移严重。
为什么这个问题难/重要
移动操作为机器人带来可控工作空间的同时,引入两大挑战:连续自运动下的空间感知 (相机随基座运动,特征失稳) 与 异构臂-基座动作协同 (自由度、频率、控制范式差异大)。业界对通用具身智能体的关注持续升温,能在多具身、多任务数据上预训练的基础模型是竞争焦点,但跨流表示学习与未来监督仍是开放问题。
行业类比
类似于多模态大模型中视觉-语言对齐,移动操作也需要一种“共同语言”让臂与基座在表征层面对齐,而非仅靠事后拼接。
核心洞察
- 移动操作的高效策略需要异构动作流之间的协同表示,而不仅是空化解耦。现有方法常将基座移动与机械臂操纵分离为独立模块,但缺乏显式跨流通信,导致长程任务中空间意图不一致。MM-ABC 通过 masked joint attention 实现两个 token 序列的注意力交互,并引入 clean-action x-prediction(预测目标末端位姿而非速度)作为信号,使两个流共享一致的空间目标。与纯解耦或完全联合控制相比,这种“分离执行 + 联合协调”的设计兼顾了动作空间的异质性和跨流信息对齐;消融显示替换为速度预测后 RoboCasa365 复合任务成功率下降 3.6 个百分点,验证了该机制的必要性。
- 利用世界想象和未来几何意图作为训练时的辅助监督,可以加强感知和意图预测,而不增加推理开销。区别于预测世界模型需要在推理时进行 rollout 或引入额外预测模块,MM-ABC 的未来分支只在训练阶段使用,通过预测未来场景几何或意图来正则化中间表示,使模型学会更鲁棒的空间推理。这类似于一种自我监督的辅助任务,将未来信息作为特权信息(privileged information)注入学习过程。在移动操作中,这种未来意图信号帮助模型克服 ego-motion 下的感知不稳定,提升长期任务成功率。消融实验表明,去除未来监督或多级条件会带来明显性能下降,证明该设计的贡献。
- 稀疏多级视觉语言模型特征为跨具身移动操作提供了统一的感知表示,兼顾语义与空间细节。与显式 3D 重建或稠密点云表示相比,稀疏特征在不同视觉层级采样,既保留了物体/场景的语义信息,又提供了多尺度几何线索,且计算效率更高。对于连续 ego-motion 的移动平台,这种表示对视角变化更具鲁棒性,并能与自然语言任务描述对齐。在 MM-ABC 的预训练中,模型使用 12 个数据集、17 种具身形态、40 万+ episodes 的数据,证明该感知方案可扩展到异构机器人数据。
方法
输入与感知
MM-ABC 以多模态观测为输入,包括 RGB 视觉、本体状态等。感知侧使用稀疏多级 VLM 特征(sparse multi-level VLM features),在多个抽象层级提取空间语义,应对连续 ego-motion 下的几何漂移;相比稠密 3D 重建,计算更轻且保留可迁移的语义定位能力。
关键模块
- 结构化双流动作生成:将 arm 与 base 动作解耦为两个并行的 token 流,并引入 MM-APT(Masked joint attention + clean-action prediction)进行协调。MM-APT 通过 masked joint attention 实现跨流信息交换,同时避免过度耦合;输出为 clean action(如末端位姿增量、关节目标),而非原始速度指令,使学习目标更稳定。
- 未来几何辅助监督:训练时添加一个 future branch,利用世界想象与几何意图(geometric intent)预测未来场景几何或操作意图,作为额外监督信号增强感知表征与 manipulation-intent 预测,提升主任务学习信号。该分支仅在训练时存在,推理时不增加开销。
输出与训练目标
模型输出解耦的 arm/base 动作流,可直接用于执行。训练 loss 由主动作预测 loss 与未来辅助 loss 组成,在 5000+ 小时多具身数据上预训练。
与同类方法差异:在显式解耦基础上增加跨流协作表征,并以未来几何作为辅助监督;用 clean-action prediction 替代 velocity prediction,显著提升复合任务成功率。
实验
实验设计
在多个仿真基准(EBench、RoboCasa365、ManiSkill-HAB、LIBERO、LIBERO-Plus)以及真实世界移动操作任务上评估 MM-ABC。预训练采用 5,000+ 小时多机器人数据(400K+ episodes、12 个数据集、17 种 embodiment)。消融实验考察动作预测参数化(clean-action vs velocity)、未来监督分支、多级感知条件的重要性。
关键发现
MM-ABC 在 EBench 上达到 44.71% 成功率,RoboCasa365 上 61.2%,LIBERO 上 99.1%,LIBERO-Plus 上 82.8%(未使用扰动训练),真实世界五项任务平均 83% 成功率。消融显示,将 clean-action 预测替换为 velocity 预测导致 RoboCasa365 composite-seen 任务成功率从 32.8% 降至 29.2%;移除未来监督或多级条件化会导致更大性能下降。表明 clean-action 参数化、未来几何监督和多级视觉特征对移动操作协同至关重要。
与基线对比解读
摘要未提供直接基线模型对比数字,但从消融实验可推断 clean-action 相比 velocity 预测的增益(+3.6 pp),且未来监督和多级条件的增益更大(原文 "larger drops")。该结果支持论文核心论断:移动操作需要解耦但高效的跨流协作,未来世界想象和几何意图作为额外监督能强化感知与操作意图预测。与仅使用显式 3D 或预测世界模型的方法相比,MM-ABC 通过稀疏多级 VLM 特征和 masked joint attention 实现更轻量的空间感知与协调。
行业影响
落地场景
仓储物流:移动机械臂在电商履约中心进行跨货架拣选、补货与打包,替代固定工位机械臂,覆盖更广工作区域。
医疗配送:医院内跨楼层运送药品、器械,并完成台面抓取放置,减少护士重复劳动。
零售商超:夜间自动补货、货架整理,降低夜班人力依赖。
家庭服务:移动服务机器人执行桌面取物、开门等复合任务,提升家庭自动化水平。
商业价值
- 降本:单一移动操作平台替代“固定臂+传送带”组合,减少硬件与集成成本;预训练模型降低任务级数据采集与训练开销。
- 增收/体验提升:高成功率(如 RoboCasa365 61.2%、EBench 44.71%)缩短任务完成时间,提高自动化吞吐;真实场景中减少人工干预,提升服务一致性和可用性。
与现有产品/工作流接口
- 模型层:以预训练权重形式集成,支持轻量微调(如 LoRA)适配不同本体(17 种 embodiments),无需从零训练。
- 推理部署:输入多视角 RGB-D 与本体状态,输出解耦的末端位姿与底盘速度指令,兼容 ROS 2 消息格式。
- 数据管线:利用其 数据引擎 清洗异构数据,可将企业自有数据混入继续预训练,提升特定场景表现。
具体用例:电商仓储中,移动机械臂从不同货架抓取 SKU 放入订单箱;医院中,机器人跨楼层取送药品并放置到护士站台面。
局限
- **数据依赖与计算成本**: MM-ABC 需要 5,000+ 小时、400K+ episodes、12 个数据集和 17 种 embodiment 的异构预训练,数据引擎包含语义审计、清洗和规范化。如此规模的数据收集与工程化处理对大多数团队构成壁垒,且自采集移动操作数据成本高。虽然论文声称平衡采样,但不同 embodiment 的动力学差异可能引入噪声,影响策略收敛。工程启示:实际部署时优先考虑仿真数据或数据高效微调,而非全量预训练。与 OpenVLA 等大规模模型相比,MM-ABC 的数据规模并非最大,但异构性带来的对齐难度可能被低估。
- **推理时缺少未来监督与在线规划**: 未来分支(future branch)仅作为训练辅助,推理时模型仅依赖当前观测和隐式历史生成动作,无法显式利用几何意图或预测未来状态。在需要长程规划、动态避障或干扰恢复的任务中,模型可能缺乏在线重规划能力。真实世界实验仅覆盖 5 个固定任务且无扰动训练,可能高估鲁棒性。对比基于 MPC 或显式世界模型的方法,MM-ABC 的闭环适应能力有限。工程启示:可考虑将未来预测作为辅助输出或集成 MPC 上层,但会增加推理延迟。
- **感知缺乏显式 3D 表示,几何推理可能受限**: MM-ABC 使用稀疏多级 VLM 特征进行空间感知,虽结合 geometric intent 作为监督,但未构建显式 3D 表征(如点云、体素或神经场)。在需要毫米级定位或复杂物体交互的任务中,VLM 特征可能不足以提供精确几何信息。消融显示移除 future supervision 或 multilevel conditioning 导致成功率大幅下降,说明对特征设计敏感。与 PerAct、RVT 等显式 3D 方法相比,MM-ABC 在几何推理上可能存在差距。工程启示:可融合深度传感器或 3D 占用网络增强空间理解,但会牺牲一定的泛化性。