论文

Rethinking VLM Representation for VLA Initialization

Rethinking VLM Representation for VLA Initialization

Vision-Language-Action (VLA) 模型广泛采用预训练的 Vision-Language Models (VLMs) 作为策略骨干,但何种预训练 VLM 表示 对 VLA 初始化有用尚不明确。本文沿三个维度将 VLA 初始化视为可控的表示设计问题:能力级具身 VQA 监督、参数更新策略 和 机器人数据预训练。 实验表明,原始预训练 VLM 表示 是动作性能的关键来源。然而,具身 VQA 适应并未带来统一收益:其效益取决于下游瓶颈,且不同能力领域的增益并非简单叠加。对于更新策略,LoRA 比 Full Finetune 提供更可靠的初始化,表明过度重塑预训练表示会削弱 VLA 初始化。机器人数据预训练 进一步改善 VLA 初始化,最强变体通过分阶段 LoRA 训练获得。 综上,有效的 VLM 到 VLA 适应应注入与动作相关的具身和机器人轨迹信号,同时保留对动作学习仍然有用的预训练 VLM 表示。

论文精读

TL;DR 研究VLA初始化三要素(具身VQA、更新策略、机器人数据预训练),发现LoRA分阶段训练能最好地保留预训练VLM表征并注入动作信号。

问题

问题背景
VLA 模型已成为语言条件机器人操控的主流范式,普遍以预训练 VLM 作为策略主干,期望继承其视觉语言理解能力。然而,什么样的 VLM 表示最适合 VLA 初始化,以及如何高效注入具身信号,仍是一个开放且受控不足的问题。

现有方法局限
当前实践多采用冻结 VLM 或全参数微调,但缺乏对表示层面收益的系统分析:

  • 冻结方案虽保留原始 VLM 的通用先验,却难以捕获任务特定的动作相关特征,导致策略性能在复杂操控任务中遭遇瓶颈。
  • 全参数微调可能过度重塑预训练表示,造成灾难性遗忘,且对稀缺的机器人数据利用效率低下。
  • 部分工作引入 LoRA 等参数高效调整,但未厘清 具身 VQA 多领域监督更新策略 之间的受控影响——不同能力(如空间推理、物体交互)的适应增益是否可加、何时会产生负迁移,尚不明确。

为什么这个问题难 / 重要
VLM 的抽象语义空间与具身动作空间存在分布偏移,直接的迁移易产生次优策略;而机器人数据昂贵且环境交互成本高,要求最大程度利用预训练知识。此外,具身能力的维度多样,单一领域的适应可能干扰其他技能,增益并非简单相加。因此,精细设计 VLM 到 VLA 的表示转换路径,理解保留多少原始表示、注入多少具身与轨迹信号,是实现高效少样本策略学习的关键,对降低具身智能落地的数据壁垒具有重大工程意义。

行业类比
如同在 LLM 应用微调中,平衡基础语言能力与垂直领域知识是产品可靠性的基石,VLA 初始化的表示设计直接决定机器人策略的泛化边界与训练成本。

核心洞察

  • 预训练 VLM 的原始表征是 VLA 动作学习的核心基础,但注入具身知识需要精细控制,不可盲目全量适配。该研究证明,未经任何具身微调的 VLM 表征本身就能提供可观的策略性能,而常见的具身 VQA 适配并非均匀有益,其效果取决于下游任务的感知-行动瓶颈,且多领域能力的增益不简单叠加。这与许多工作假设“越多具身微调越好”不同,揭示了 VLM 到 VLA 迁移中表征破坏的风险。
  • LoRA 作为参数更新策略比全量微调提供更可靠的 VLA 初始化,表明有效迁移应“注入”而非“重写”预训练表征。实验发现,LoRA 在保留基础视觉语言能力的同时,引入了必要的动作相关信号,而全量微调会过度重塑表征,削弱原本有用的预训练知识。这一观察挑战了认为参数层面的大幅度调整更有利于下游控制的直觉,为 VLA 训练策略选择提供了清晰指引。
  • 分阶段 LoRA 训练——先具身 VQA 注入能力信号,再机器人数据预训练引入轨迹知识——实现最强 VLA 初始化。这揭示了能力注入的时序与方式的协同效应:先获取可泛化的具身语义,再聚焦于特定操控的动力学,可最大化预训练表征的效用。该方法在少量监督下显著提升操控成功率,为资源受限的大模型机器人部署提供了工程上可复现的优化路径。

方法

方法概览:从 VLM 表示设计角度的 VLA 初始化研究

本研究将 VLA 初始化 形式化为一个可控的表示设计问题,围绕三个轴展开:Embodied VQA 能力监督参数更新策略机器人数据预训练。整体采用 两阶段训练管道:第一阶段在 VLM 基础上注入 embodied 信号;第二阶段加载该初始化权重,在机器人数据上学习动作策略。

输入与初始化骨干

  • 输入:视觉观测(多视角图像)和语言指令。
  • 骨干网络:预训练的 VLM(如 LLaVA 系列),其视觉编码器和语言模型提供初始表示。

三个研究轴与关键模块

  1. Embodied VQA 适应
    在 VLM 上添加不同类型的能力域 VQA 监督(如导航、操作、物体关系推理),以调整视觉-语言表示。单域适应揭示能力迁移的瓶颈依赖性,多域组合显示收益非简单加和
  2. 参数更新策略
    对比 Full FinetuneLoRA 对下游动作学习的影响。LoRA 通过低秩适配器更新参数,更少侵入原表示空间,保留对动作学习有用的 VLM 特征。
  3. 机器人数据预训练
    在具身 VQA 适应后、动作微调前,利用大规模机器人轨迹数据(如 Open X-Embodiment)进行额外预训练,进一步对齐表示与操控场景的分布。

训练流程与输出版本

最终推荐的最强初始化方案为 staged LoRA

  • 第一阶段:在机器人数据上使用 LoRA 预训练,注入轨迹层面运动信号。
  • 第二阶段:在同一 LoRA 适配器上继续动作策略微调,仅更新 action head 和 LoRA 权重,原始 VLM 权重保持冻结。 输出为末端执行器位姿或关节动作,由一个小型 action token 解码器 将 VLM 输出的隐状态映射为控制指令。

与同类方法的差异:现有 VLA 多直接全量微调 VLM 或采用固定适配器,本工作首次系统解耦并验证了保持原始 VLM 表示完整性对动作学习的核心价值,并提出“注入任务信号而不摧毁有用表示”的 LoRA staged 范式。

实验

实验设计

  • 采取两阶段管道:阶段1用 embodied VQA 数据适应 VLM,阶段2在机器人数据上训练 VLA 策略
  • 对比三种轴:VQA 监督类型(单域、多域组合)、参数更新策略(LoRA vs 全微调)、机器人数据预训练(有或无)
  • 评估在不同机器人操作任务上的成功率

关键发现

  • 原始预训练 VLM 表示对动作学习至关重要,LoRA 比全微调更可靠,保留了丰富的视觉语言先验
  • Embodied VQA 适应增益并非均匀:下游视觉或语言瓶颈决定了哪种 VQA 域有益,多域增益不可简单叠加
  • Staged LoRA-based training 先做多域 VQA 适应再做机器人数据微调,获得最强初始化,表明序列注入 embodied 和轨迹信号优于直接混合

与基线对比

  • 标准基线为冻结 VLM 后接动作头,或全微调整个模型:全微调初始学习快但容易过拟合机器人数据,丢失预训练表示,导致泛化下降
  • 本工作表明保留 VLM 表示强度与动作性能正相关,LoRA 实现了更好的表示保留与任务适应平衡
  • 进一步加入机器人数据预训练,使用 staged LoRA,性能超过所有基线,说明显式控制表示变化是 VLM→VLA 迁移的关键

行业影响

落地场景

论文提出的 VLM 到 VLA 优化初始化策略,直接赋能 具身智能机器人 的控制系统,尤其适用于需要理解自然语言指令并执行操作的任务。典型场景包括:

  • 家庭服务机器人:根据口语指令(如“把桌上的红杯子拿给我”)完成灵巧抓取和导航,快速适应不同家庭环境。
  • 工业与物流机器人:在仓储分拣、装配等环节,依据语言命令操作形状、尺寸各异的新物体,减少针对每类 SKU 的数据采集成本。

商业价值

  • 降本:通过采用 LoRA 分阶段训练 并保留预训练 VLM 表示,大幅降低对昂贵机器人演示数据的依赖,缩短技能训练周期,节省算力与人工标注开支。
  • 增收:机器人策略的泛化能力提升使得产品能够快速覆盖长尾任务和新场景,加速市场渗透;同时更少的任务定制时间意味着更高的交付效率。
  • 体验提升:增强机器人对复杂指令的理解准确性和执行鲁棒性,在家庭、商用等场景中提高用户信任与满意度。

与现有产品/工作流的接口

现有 VLA 系统大多以预训练 VLM(如 LLaVA, Flamingo)为骨干,本文的初始化方法可无缝嵌入标准训练流水线:

  1. 第一阶段:使用 embodied VQA 数据(空间推理、物体属性等)对 VLM 进行 LoRA 适配,注入具身常识。
  2. 第二阶段:利用历史机器人轨迹数据进行 LoRA 预训练,学习动作先验。
  3. 第三阶段:在下游任务上,冻结 VLM 骨干,仅用 LoRA 微调动作头。

这一流程可通过 HuggingFace PEFT + Transformers 实现,并与 ROS 等机器人中间件集成;LoRA 适配器可独立分发,支持云端训练、边缘推理。

具体用例

  • 电商仓库机器人:面对每日更新的海量 SKU,使用该方法训练语言条件抓取策略,仅需少量新物体演示即可泛化,大幅降低上新成本。
  • 教育陪伴机器人:根据儿童指令(如“画一个太阳”)互动,分阶段初始化让机器人快速学习新技能,同时保持行为安全稳定。

局限

  • **实验环境与任务泛化性受限**:所有实验均在模拟基准(如 LIBERO 或 CALVIN)上进行,未在真实机器人平台验证策略的部署效果。尽管模拟环境提供了可控的对比条件,但 sim-to-real 鸿沟、传感器噪声以及真实世界物理交互的复杂性均未纳入考量。这限制了结论在真实世界应用中的直接可靠性,特别是关于表示保留(LoRA)策略能否在真实视觉场景下保持鲁棒性的推断。
  • **VLM 主干模型单一且规模有限**:研究主要基于特定 VLM 架构(如 LLaVA 系列)进行,未系统考察不同 VLM 家族(如 Flamingo、BLIP-2、InstructBLIP)或不同模型规模(7B vs. 13B vs. 更大)的影响。不同 VLM 的预训练表示质量和语义空间差异可能导致结论失效,例如更强的 VLM 是否需要不同的更新策略?这削弱了“表示保留应优先于全微调”这一核心主张的普适性。
  • **embodied VQA 能力域的组合机理不明确**:研究发现多域 VQA 监督的增益并非简单叠加,但未能提供深层原因或预测方法。实验仅揭示了这种非线性现象,却未提出如何有效编排不同能力信号以最大化下游收益的指导原则。工程实践中,这限制了本文结论直接用于自动化地设计最优预训练组合方案的可能性。
论文Weifeng Lin2026-05-25原文

相关内容