论文

EXIMO: VLM 引导的 VLA 策略探索

EXIMO: VLM 引导的 VLA 策略探索

如何高效微调机器人策略以快速学习新任务?目前最先进的机器人操作策略基于行为克隆大规模视觉-语言-动作(VLA)模型,这些模型在庞大的遥操作数据集上训练,拥有数十亿参数。尽管这种简单方法推动了机器人操作的显著进展,但针对新任务微调 VLA 策略仍是一个未解决的问题。 收集遥操作数据集需要数百小时的昂贵人力,而强化学习(RL)的替代方案在长时程任务中尤其存在样本效率低的问题。此外,由于模型规模和架构设计的限制,将 RL 与 VLA 结合也面临诸多挑战。为此,我们提出 EXIMO,一种高效的 VLA 策略微调算法。EXIMO 分为三个阶段:探索(explore)、模仿(imitate) 和 优化(optimize)。在探索阶段,EXIMO 为 VLA 配备一个视觉语言模型(VLM)作为规划器,将复杂的长时程问题分解为更简单的子问题,并联合 VLA 收集编排好的新任务数据集。在模仿阶段,使用该数据集微调 VLA。最后在优化阶段,采用残差离策略强化学习进一步微调策略。 实验中对 EXIMO 的三个阶段进行了消融研究,结果表明其在样本效率和最终性能上显著优于现有方法。

论文精读

TL;DR EXIMO 用 VLM 规划分解长程任务、引导 VLA 探索收集数据,再结合模仿学习与残差 off-policy RL 微调,显著提升 VLA 策略在新任务上的样本效率与最终表现。

问题

问题背景

机器人操作领域正从单一任务模仿学习转向基于大规模预训练 VLA 模型的多任务泛化,但如何让这些模型在部署后快速学会新任务仍是一个开放问题。

现有方法局限

  • 行为克隆 (BC) 依赖数百小时人工远程操作数据,成本高且覆盖有限。
  • 在线 RL 在长程任务上样本效率极低,且 VLA 模型参数量大、自回归解码动作导致动作空间离散化,直接进行 RL 微调面临梯度估计不稳定和计算开销大的问题。
  • 现有探索方法(如 GROD)仅使用语言指令,未提供结构化任务分解,难以有效引导长程探索。

为什么难/重要

  • 长程任务需要高层任务分解和探索引导,而现有 VLA 缺乏内置规划能力,容易陷入局部分布。
  • 预训练模型与 RL 的结合需要在保持已有泛化能力的同时注入新技能,平衡灾难性遗忘与快速学习。
  • 业界高度关注机器人基础模型的高效适配,这一能力直接决定 VLA 从演示走向真实场景的落地速度。

行业类比

类似于 LLM 针对垂直领域采用“prompt 引导 + SFT + RLHF”的流程,机器人 VLA 也需要分层策略:用 VLM 作为规划器引导探索,再通过模仿与残差 RL 优化,降低数据需求。

核心洞察

  • 将 VLM 作为高层规划器分解长程任务,引导 VLA 策略进行结构化自主探索,从而替代昂贵的人类遥操作数据采集。与纯 RL 的随机探索相比,VLM 的语义推理把探索空间限制在可解子目标附近,显著提升样本效率;与纯 BC 的人类演示相比,又能用现有 VLA 自主采集合成数据。工程启示:微调数十亿参数 VLA 时,先用现成 VLM 生成子目标并采集编排数据集,可低成本获得高质量训练信号。
  • 三阶段流水线探索-模仿-优化依次利用监督微调稳定初始化、再用残差 off-policy RL 进一步精调,回避了直接在线 RL 对大规模 VLA 的优化不稳定问题。与全参数端到端 RL 微调不同,EXIMO 在预训练策略上学习残差项,保留原有泛化能力的同时提升任务特定性能。工程启示:对大型机器人策略模型,先模仿后离线 RL 的顺序比单用 RL 更稳定且样本高效,适合长程操作任务。

方法

输入与整体流程

EXIMO 输入为待学习的新任务集、预训练 VLA 策略(如 GROD)和辅助 VLM 规划器。算法按 explore → imitate → optimize 三阶段组织。

关键模块

  1. Explore(VLM 引导数据收集)

    • 将 VLM 作为高层规划器,接收任务描述和观测,分解长程任务为多个短程子任务指令。
    • VLA 在子任务指令下执行动作,产生轨迹,收集得到 orchestrated dataset。
    • 该阶段在线运行,无需人工遥操作。
  2. Imitate(监督微调)

    • 用 orchestrated data 对 VLA 做行为克隆(behaviour cloning),损失为动作预测与收集动作的交叉熵等。
    • 目的是先让策略学会 VLM 分解出的短程行为分布,稳定后续 RL 起点。
  3. Optimize(残差离线/在线 RL)

    • 在微调后的 VLA 上叠加 residual off-policy RL。
    • 冻结大模型主体,只训练轻量残差头或 adapter,避免大模型在线梯度成本爆炸。
    • 用 off-policy 数据回放提升样本效率,目标为任务成功率或稀疏奖励。

输出

最终得到可执行新任务的高效策略,相比纯 BC 或直接 RL 显著降低人工标注与交互样本需求。

与同类方法的差异点:EXIMO 将 VLM 规划、BC 预热与残差 RL 解耦,用 VLM 生成的子任务数据替代人工遥操作,并用残差结构保证大模型 RL 微调可行。

实验

实验设计叙述

EXIMO 在三阶段流程中逐一消融验证。探索阶段:将 VLM 作为高层规划器,对长程任务进行分解,指导基础 VLA 策略 GROD 收集编排数据,并与直接遥操作或随机探索对照。模仿阶段:使用编排数据对 GROD 进行监督微调,观察性能变化。优化阶段:在微调后的策略上应用残差 off-policy RL,评估在线交互的样本效率。

关键发现

实验表明,VLM 规划器能够有效将长程任务拆解为短程子任务,显著提升探索效率,收集到的编排数据比无引导探索更具信息量。基于编排数据的监督微调相比原始 GROD 有明显性能提升。进一步引入残差 off-policy RL 后,策略在少量在线样本下获得额外增益。整体上,EXIMO 在样本效率和最终成功率上均优于现有 VLA 微调方法。由于论文未提供具体数值,本部分无法量化提升幅度。

与基线对比解读

与纯行为克隆(BC)微调相比,EXIMO 利用 VLM 分解降低了长程任务的数据收集难度,缓解了 BC 对高质量示范的依赖。与直接对 VLA 进行 RL 微调相比,探索阶段的 VLM 引导减少了无效探索,优化阶段的残差设计避免了全参数 RL 的高昂成本。消融实验表明三个阶段均不可或缺,任何一部分缺失都会导致性能下降,凸显了“先规划探索、再模仿、后残差优化”的协同优势。

行业影响

落地场景

EXIMO 适用于需要快速适应新任务、新环境的机器人操作场景,尤其长程、多步操作。典型场景包括:

  • 电商仓储:拣选机器人面对频繁变化的 SKU 和货架布局,使用 EXIMO 可在少量人工遥操作演示后,通过 VLM 引导探索自动扩充数据,快速部署新拣选任务。
  • 企业服务:前台或递送机器人需完成多步交互操作,如引导访客、递送文件、开关门等,EXIMO 能将这些长程任务分解为可执行的子任务,降低 RL 训练难度。

商业价值

EXIMO 主要从降本增效和缩短部署周期两方面创造价值:

  1. 降低数据采集成本:传统行为克隆需要数百小时人工遥操作,EXIMO 用 VLM 引导的自主探索替代大部分人工,显著减少人力支出。
  2. 提高样本效率:三阶段设计使 RL 微调在离策略残差框架下更稳定,避免全模型 RL 的不稳定和大规模采样,使新任务训练可在少量 GPU 小时内完成。

对机器人厂商和服务提供商,这意味着更快地响应客户需求,以更低成本交付定制化操作能力。

与现有工作流集成

EXIMO 可作为现有 VLA 策略(如 OpenVLA、π0)的微调插件,集成路径清晰:

  • VLM 规划器:直接调用现有大模型 API(如 GPT-4V、Gemini)作为高层次规划器,无需额外训练。
  • 数据收集阶段:在现有遥操作平台或仿真环境中部署 explore-imit 流程,生成编排数据集。
  • 优化阶段:使用成熟的离策略 RL 库(如 RLlib、Stable-Baselines3)实现残差策略优化,与现有训练栈兼容。

EXIMO 不改变 VLA 架构,仅通过残差和规划器增强,因此可无缝接入当前机器人学习流水线,升级成本低。

局限

  • **VLM 规划器的可靠性与计算开销** EXIMO 的探索阶段高度依赖 VLM 将长程任务分解为可执行子任务,但 VLM 本身可能产生错误规划或不一致分解,导致编排数据中包含错误示范或次优轨迹。论文未系统评估 VLM 规划失败率及对下游模仿学习和 RL 的影响。此外,在真实机器人操作中引入 VLM 推理会带来额外延迟与 GPU 资源消耗,可能限制实时应用。若 VLM 能力弱于 VLA 的行动推理,反而可能成为瓶颈。
  • **多阶段流水线的工程复杂性与调参成本** EXIMO 由 explore、imitate、optimize 三个阶段组成,每个阶段都涉及 VLM、VLA、off-policy RL 等多个组件,需要分别调整数据收集比例、训练轮数、RL 超参数等,实际部署难度较高。残差 off-policy RL 在数十亿参数 VLA 上的数值稳定性尚未充分论证,训练崩溃或性能回退的风险可能影响方法普适性。与单一阶段的 RL 微调或 SFT 相比,系统复杂度显著增加。
  • **实验评估范围有限,缺乏真实世界泛化验证** 论文实验主要基于预定义任务套件和仿真环境,虽然展示了样本效率优势,但未在真实机器人上验证 VLM 编排数据收集的可行性与安全性。VLM 在视觉感知噪声、遮挡、动态环境下的规划能力可能大幅下降,论文未覆盖这些场景。此外,不同 VLA 架构对 EXIMO 各阶段的兼容性未充分探讨,结论的外推性存疑。
论文Bhavya Sukhija2026-08-20原文

相关内容