论文

MA-VLA: 面向协作与组合泛化的多臂视觉-语言-动作模型

MA-VLA: 面向协作与组合泛化的多臂视觉-语言-动作模型

多臂协作正成为具身操作的核心能力。近期视觉-语言-动作模型(VLA)整合了感知、语言与控制,但多数模型将语言表示为单一全局指令,缺乏为各机械臂分配和组合臂特定行为的显式机制。这种设计限制了模型向训练中未出现的协作模式的泛化。 我们提出 MA-VLA,一种通过原子动作分配实现多臂协作的统一框架。MA-VLA 将协作行为分解为中层原子提示,并分配给各机械臂,从而支持显式子目标指定与跨任务组合复用。为减少对固定执行角色的依赖,我们引入 Arm Shuffle,一种训练时对每个机械臂的观测、状态和分配的原子提示进行置换的策略。该置换强制模型进行与角色无关的指令遵循,并支持重组合成未见过的协调模式,即多臂组合泛化。我们还构建了一个基准,其中测试时的协作模式在训练集中不出现。 在仿真和真实世界评估中,现有最优 VLA 在未见过的协作场景下大多失败,而 MA-VLA 持续成功。这些结果表明,结构化的、逐臂原子动作分配为多臂具身系统的可扩展泛化提供了实用途径。代码、模型和数据见 https://github.com/zhangzaibin/future-robots

论文精读

TL;DR MA-VLA 将多臂协作分解为原子动作并分配给各臂,通过训练期 Arm Shuffle 实现角色无关指令跟随,从而在未见协作模式上取得显著泛化。

问题

问题背景

多臂协作是具身智能领域的新焦点,机器人需要同时操作多个末端执行器完成复杂长程任务。视觉-语言-动作模型(VLA)已成为整合感知、语言与控制的主流范式。

现有方法局限

当前多臂 VLA 多数将自然语言指令编码为单一全局嵌入,缺少面向单臂的子目标分配机制。具体表现为:

  • 无法显式指定每个臂的阶段性目标,导致行为绑定在固定执行角色上;
  • 训练数据中出现的协作模式被隐式记忆,测试时遇到未见过的组合模式容易失配;
  • 语言条件与臂身份强耦合,难以将已学原子技能重新组合。

与 MA-VLA 等结构化方法相比,现有做法忽视了每个臂的局部可组合性,工程上导致单臂技能无法复用,模型规模增加并未带来协作泛化收益。

为什么难/重要

多臂协作的组合空间远大于单臂,完整采集所有协作模式不现实。因此模型必须从有限数据中学会角色无关的指令跟随,并通过原子动作重组实现组合泛化。这与多智能体系统、模块化机器人等方向有共同技术挑战。业界对双臂/多臂装配、搬运、协作服务的需求正在上升,VLA 的泛化能力直接决定多臂系统能否落地。

行业类比

这类似从单智能体 LLM Agent 到多智能体编排框架的演进:仅靠全局 prompt 无法协调多个执行体,必须引入可组合的子任务规范和动态分配,才能应对未见过的协同场景。

核心洞察

  • - **原子动作分配**:将多臂协作任务分解为 mid-level atomic prompts 并分配给每个机械臂,显式表达逐臂子目标。相比现有 VLA 将语言编码为单一全局指令、缺乏臂级行为分配机制,MA-VLA 通过子目标级别的组合复用实现跨任务迁移,缓解协作模式与训练分布偏移时的泛化瓶颈。
  • - **Arm Shuffle**:训练时对 observation、state 和 assigned atomic prompts 进行逐臂置换,强制模型不依赖固定执行角色,学习 role-agnostic 指令跟随。这使得模型能将已学原子技能重组为未见过的多臂协调模式(compositional generalization)。在专门构建的 out-of-domain benchmark 中,现有 SOTA VLA 大幅失效,而 MA-VLA 持续成功,证明结构化表示对组合泛化的必要性。

方法

输入:多臂机器人接收自然语言指令、多视角视觉观测(RGB 图像或点云)、各臂当前状态(关节位置/末端位姿)。

关键模块:

  • VLM-based Planner:使用视觉语言模型将全局任务指令分解为 mid-level atomic prompts(如“抓取红色物体”“按住底座”),并将每个 atomic prompt 分配给特定臂。该步骤显式规定子目标和臂间分工,避免单一全局指令的模糊性。
  • VLA Executor:基于预训练 VLA 模型扩展为多臂架构。执行器接收原始观测、各臂状态以及分配给各臂的 atomic prompt,经视觉编码器和语言编码器融合后,通过动作头输出每个臂的底层控制信号(如末端位姿或关节角增量)。

训练策略:

  • Arm Shuffle:在每个训练 step,对双臂的观测帧、状态向量和分配的 atomic prompt 同时进行随机排列。强制模型不依赖固定臂身份(左/右),而是根据 atomic prompt 内容动态匹配对应臂,从而学习角色无关的指令跟随。该策略支持测试时重新组合未见的协作模式。
  • View Dropout:随机丢弃部分视角输入,增强模型对视角缺失或遮挡的鲁棒性。

输出:各臂同步或异步的动作序列,完成多臂协作任务。

与同类方法差异:不同于以往 VLA 仅使用单一全局语言指令驱动多臂,MA-VLA 通过显式 atomic action assignment 与 Arm Shuffle 训练技巧,实现多臂组合泛化到训练中未见的协作模式。

实验

实验设计

作者构建了包含仿真与真实环境的多臂协作基准,关键设计是测试集中的协作模式在训练集中完全未出现,以检验组合泛化能力。训练策略上引入 Arm Shuffle 随机置换各臂的观测、状态与原子提示,并对比多种现有 VLA 基线。

关键发现

  • 在未见协作模式下,现有 SOTA VLA 基线大多失败,而 MA-VLA 始终成功完成任务。
  • 这表明直接输出全局指令的模型难以将行为重组到新臂间组合,而原子动作分配 + Arm Shuffle 带来了角色无关的指令遵循。
  • 消融实验显示 Arm Shuffle 概率与独立模块设计对性能有明显影响。

与基线对比解读

现有 VLA 将语言作为单一全局指令,缺乏臂级行为指派机制,因此在面对训练分布之外的协作模式时无法有效迁移。MA-VLA 通过将合作行为分解为中层原子提示并分配给具体机械臂,使策略可以复用原子动作并重新组合,从而实现多臂组合泛化。这一差异说明在复杂具身系统中,结构化分解与角色解耦比单纯扩大模型规模更有利于泛化。

行业影响

落地场景

MA-VLA 主要落地于需要多臂协同的物理操作场景:

  • 电商仓储自动化:在多 SKU 拣选、打包、上下料等环节,多机械臂需动态分配子任务(如左臂取物、右臂装箱),MA-VLA 的原子动作分配可让同一套模型适配不同工位组合,应对大促波峰时的柔性换线。
  • 精密装配 / 实验室自动化:双臂配合完成拧螺丝、试剂移液等动作,原子 prompt 可直接对应动作原语(如 grasp、place、screw),便于工程师编辑和复用,减少对固定示教轨迹的依赖。

商业价值

  • 降本:通过组合泛化,同一套 MA-VLA 权重可覆盖多种协作模式,无需为每种双臂任务单独采集数据或训练模型,降低数据收集与模型迭代成本。
  • 增收 / 吞吐提升:多臂并行执行原子动作,相比单臂串行流程可显著缩短节拍,提升仓储吞吐或装配效率;在柔性制造中,换线时间从小时级降至分钟级。
  • 体验提升:角色无关的 Arm Shuffle 使机器人不再依赖固定“左臂/右臂”预设,任意臂可执行任意原子动作,让部署更鲁棒,减少人工重新标定。

与现有产品 / 工作流接口

MA-VLA 可作为 策略层模块 嵌入现有机器人软件栈:

  • 与 ROS/ROS2 集成:将 VLM 规划器的原子 prompt 输出映射为 ROS Action 或 Service 的 goal,VLA 执行器的动作输出(关节角度 / 末端位姿)通过 trajectory_msgs/JointTrajectory 下发到真实机械臂控制器。
  • 与现有单臂 VLA 兼容:MA-VLA 的多臂架构可视为对 OpenVLA、RT-2 等单臂模型的扩展,保留视觉编码器与语言编码器,新增 per-arm token 与 permutation 机制,可在已有推理服务中通过增加 arm index 字段实现迁移。
  • 工程启示:训练期 Arm Shuffle 与 View Dropout 不改变推理时参数规模,可直接用于数据增强,适合在已有多臂模仿学习数据上低成本重训;对于已有产品,可先以“高层任务分解器 + 底层单臂控制器”的方式逐步过渡,降低集成风险。

局限

  • **依赖原子动作标注**。MA-VLA 需要为训练数据提供 mid-level atomic prompts,这些标注在现有大规模机器人操作数据集中并不存在,需要额外的人工标注或自动生成流程,限制了在无标注数据上的直接扩展。同时,VLM-based planner 的任务分解质量直接影响下游执行,复杂长期任务中规划错误会累积传播到 VLA executor,缺乏端到端联合优化的纠错机制。
  • **Arm Shuffle 的空间扩展性有限**。训练时对每臂的 observation / state / atomic prompt 进行置换,当臂数增加到三臂及以上时,置换组合数量呈阶乘增长,训练成本急剧上升。论文实验主要基于双臂配置(如 real-world dual SO100),未验证三臂或更多臂场景下的有效性。此外,物理臂的构型可能存在非对称约束,随机置换不一定保持执行的物理可行性。
  • **真实世界验证规模较小**。论文在真实世界仅展示了 dual SO100 场景,任务数量和试验次数可能有限,难以充分评估在复杂光照、遮挡和传感器噪声下的鲁棒性。与仿真 benchmark 中系统性的 unseen collaboration pattern 测试相比,真实世界未系统覆盖多种未见协作模式,泛化结论的置信度有待更大规模真实实验支撑。
论文Zaibin Zhang2026-08-26原文

相关内容