通过表示锚定与语言-动作对齐的可泛化 VLA 微调
背景:通过行为克隆(BC)在机器人演示上微调预训练视觉语言模型(VLM)已成为视觉-语言-动作(VLA)策略的标准做法。然而,BC 微调会逐渐覆盖支撑视觉和语义泛化的预训练表示。常见的补救措施——在 web 图文数据上联合训练——并不能阻止这一点;它将语言和动作损失应用于不同的观察,导致 VLA 存在语言-动作不对齐,而标准操作基准无法暴露此问题。 方法:我们提出 Anchor-Align,它在 BC 基础上增加两个目标:Vision-Language Anchoring(视觉-语言锚定)从冻结的 VLM 副本中蒸馏逐层表示以防止漂移;Language-Action Alignment(语言-动作对齐)将每个动作目标转化为离散的运动方向标签,并在同一机器人观察上联合训练语言和动作预测。 实验:在物理 xArm7 机器人上,跨两种广泛使用的 VLA 架构,Anchor-Align 将真实机器人成功率分别从 28% 提升至 54% 和从 37% 提升至 60%。在模拟规模上,我们在 LIBERO-PRO、LIBERO-Plus 和 CALVIN 上分别展示了在 OOD 扰动、感知鲁棒性和长期控制方面的一致改进,表明保留预训练表示和有效动作学习并非根本矛盾。
论文精读
TL;DR Anchor-Align 用冻结 VLM 锚定表示并将动作转化为语言对齐标签,解决 VLA 微调中的表示漂移与语言-动作错位,在真实和仿真环境中大幅提升泛化。
问题
问题背景
在机器人操控领域,基于 视觉-语言-动作(VLA) 策略的微调已成为标准范式:先在大规模 web 数据上预训练 视觉语言模型(VLM),再通过 行为克隆(BC) 在机器人演示上微调,得到可执行自然语言指令的策略。
现有方法的局限
BC 微调会逐步覆盖预训练表征,损害视觉和语义泛化能力。常见补救手段是联合训练 web 图文数据,但该方法存在两个关键缺陷:
- 语言和动作损失作用于不同观测(web 数据无动作标签,仅用于语言预测),导致语言-动作表示在模型内部不对齐,标准 benchmark 无法暴露此问题。
- 联合训练 不能真正阻止表征漂移,因为语言和视觉的预训练知识仍然会被动作学习的梯度冲刷。
技术挑战与重要性
VLA 需同时满足精确动作控制与高阶指令理解,但微调过程中二者天然冲突:动作学习会覆盖语言理解所需的中间表示,而分离的损失函数无法建立语言-动作的对应关系。这导致模型在分布外(OOD)扰动、感知鲁棒性、长序列任务上性能急剧下降。随着 VLA 在真实机器人上的应用日益广泛,如何在不遗忘预训练知识的前提下有效学习动作已成为业界核心关注点。
行业类比
这一问题类似于大语言模型微调时导致的安全对齐能力丢失——下游任务梯度更新可能冲淡预训练的通用知识,而简单的正则化往往无法同时保留原始能力和适配新任务。
核心洞察
- 表示锚定与动作对齐的协同可以打破微调中泛化与动作学习的 trade-off。本工作通过同时保留视觉-语言表示并强制语言-动作对齐,证明保持预训练泛化能力与有效动作学习并不矛盾。与常见的联合训练或 L2 正则不同,这些方法要么在分离的观测上分别计算语言和动作损失导致错位,要么无法阻止表示漂移。Anchor-Align 将表示蒸馏与离散动作-语言联合训练结合,针对性解决了两个独立瓶颈,在仿真与真实机器人上均实现稳健提升。
- 将连续动作离散化为语言对齐的标签,能够暴露标准基准中隐藏的错位问题。传统 VLA 在 LIBERO 等基准上表现尚可,但在实际扰动或长序列场景下泛化骤降。Anchor-Align 将动作转换为离散运动方向,并用同一观测联合训练语言和动作预测头,迫使多模态表示一致。实验发现语言-动作对齐度与任务成功率正相关,直接量化了先前被忽视的错位现象,为诊断和提升 VLA 泛化性提供了新工具。
方法
方法概述
Anchor-Align 在行为克隆(BC)微调基础上引入两个辅助目标,旨在解决 VLA(视-语-动)策略微调过程中的两大问题:预训练表征遗忘 和 语言-动作错位。
输入:机器人观测(图像)与自然语言指令,经视觉编码器和语言模型(如预训练 VLM)编码为隐空间表示。
关键模块
Vision-Language Anchoring(视-语锚定)
保留一个冻结的预训练 VLM 副本,在微调过程中逐层蒸馏其表征。具体地,对每个 Transformer 层的输出计算与冻结副本对应层输出的相似性损失(如 L2 距离),强制可训练模型保留预训练知识,防止因 BC 微调导致视觉语义泛化能力退化。Language-Action Alignment(语言-动作对齐)
将连续动作目标(如末端位移)离散化为运动方向标签(例如“左移”、“上移”、“夹爪闭合”等),并利用同一个观测同时预测语言 tokens 和离散动作标签。语言预测采用标准的 next-token 损失,动作预测使用交叉熵。这种联合学习确保语言与动作在共享表征空间中紧密耦合,避免传统 Co-training 中因不同观测分开计算损失而导致的错位。
输出与训练
最终损失为 BC 损失 + 锚定损失 + 对齐损失 的加权和。训练完成后,模型直接根据当前观测和语言指令输出动作,不再依赖冻结副本。
与同类方法的差异: 相较于仅通过 Web 数据 Co-training 来减缓遗忘的 OpenVLA 等方法,Anchor-Align 首次将表征保持与语言-动作对齐显式解耦并提出针对性约束,同时将连续动作离散化为方向监督信号,从根本上解决了表征漂移和错位之间的耦合问题。
实验
实验设计
- 评估基准:在三个模拟环境和真实机器人上进行。模拟库包括 LIBERO-PRO、LIBERO-Plus (侧重 OOD 扰动和感知鲁棒性) 以及 CALVIN (长程任务链)。真实机器人采用 xArm7 执行操作任务。
- 基线方法:标准行为克隆微调 (BC),以及常见的 Web 图像-文本同训练策略。两种主流 VLA 架构均被测试。
- 消融分析:分别检验 Vision-Language Anchoring 和 Language-Action Alignment 的独立贡献,并通过 shuffle 和 scatter 对照实验确认对齐效果并非单纯正则化。
关键发现
- 真实机器人成功率大幅提升:架构一从 28% → 54% (+26%),架构二从 37% → 60% (+23%)。
- 模拟实验中,在 OOD 扰动、感知鲁棒性和长程控制上均取得一致改进,表明 保留预训练表示 与 有效动作学习 可以协同。
- 语言-动作对齐程度 与任务成功率呈正相关,验证了设计动机。
- 锚定蒸馏 有效抑制了微调过程中的表示漂移,对齐头 将动作转化为离散运动方向标签,促进语言与动作在相同观测上的联合学习。
与基线对比深度解读
传统 BC 微调会逐渐覆盖 VLM 的预训练表示,损害泛化能力。辅助 Web 同训练虽常见,但 语言损失和动作损失施加于不同观测,导致语言-动作错位,且标准操作 benchmark 难以暴露此缺陷。
Anchor-Align 通过冻结原始 VLM 进行逐层蒸馏,将预训练表示锚定,防止其被覆盖;同时将对齐任务直接构建在同一机器人观测上,将动作转化为离散标签,确保 语言和动作在特征空间紧密耦合。消融实验表明,两个组件缺一不可,且对齐带来的收益远大于 shuffle/scatter 等正则化手段。
对比结果说明,显式正则化无法替代结构化的语言-动作对齐;而锚定与对齐的共同作用,实现在不牺牲预训练知识的前提下,有效提升操作策略的泛化性和鲁棒性。
行业影响
落地场景
Anchor-Align 直接面向具身智能领域,可赋能任何使用 VLA(视觉-语言-动作)策略的机器人产品,尤其是在仓储分拣、家庭服务、柔性制造等需要泛化到新物体、新布局和新语言指令的场景。当前主流的 VLA 微调方案(如 OpenVLA、RT-2)普遍存在预训练表征被覆盖导致的“灾难性遗忘”,Anchor-Align 的表征锚定和语言-动作对齐机制可即插即用,大幅提升策略在未见过环境(OOD)下的成功率。
商业价值
- 降本:减少对大规模、多样化机器人演示数据的依赖,降低重新采集和标注的成本。真实机器人实验中,在 xArm7 上仅用少量演示就将成功率从 37% 提升至 60%,意味着更短的部署周期和更少的人力投入。
- 增效:仿真 benchmarks(LIBERO-CALVIN)上长程任务和扰动下的稳定提升,可使机器人产线快速切换任务,减少停机时间。
- 体验提升:更强的语言-动作对齐让机器人能够精确跟随复杂自然语言指令,提升人机交互的自然度和成功率,适用于需要灵活人机协作的智能助理场景。
与现有产品/工作流的接口
Anchor-Align 可以无缝集成到当前主流的行为克隆训练管线中,作为附加损失函数与行为克隆联合优化,无需修改模型结构(已在 Prismatic VLM 和 OpenVLA 两种架构上验证)。工程上,只需在训练时保留一份冻结的预训练 VLM 副本用于蒸馏,并增加一个轻量级的语言-动作对齐头。其训练成本与标准 BC 方案相当(论文 B.3 节比较),可直接嵌入已有的仿真训练→实物迁移流程,与 ROS2、Isaac Sim 等工具链配合。
具体落地 Use Case
- 电商仓储自动分拣:在 Amazon Robotics 类似场景中,机器人需要处理千万级 SKU 和频繁变化的货架布局。使用 Anchor-Align 微调的 VLA 策略可让机械臂根据“将蓝色包装盒放到第二层货架”等自然语言指令执行操作,即使盒子形状或货架位置在训练中未见过,也能保持高成功率,减少人工干预。
- 酒店/医院配送机器人:服务机器人在动态环境中需要理解模糊指令(如“把药送到 302 病房”),并应对走廊临时障碍物。Anchor-Align 强化了视觉-语言对齐,使机器人能从预训练 VLM 中保留更多常识推理能力,提升任务执行的可靠性和用户信任度。
局限
- 方法依赖一个冻结的 VLM 副本提供逐层表示蒸馏目标,显著增加了训练阶段的显存与计算开销,限制了可扩展至更大模型或资源受限场景的可行性。蒸馏强度与动作对齐的权重需要额外调参,增加了工程复杂度。
- 在 Language-Action Alignment 中,连续动作被离散化为运动方向标签,虽然简化了联合训练,但可能丢失精细速度与力控信息,对于需要高精度力的操作或复杂轨迹控制的任务,性能可能受限,且离散化粒度的选择缺乏理论指导。
- 真实世界验证仅在 xArm7 单臂机器人上执行拾放类任务,任务多样性和场景复杂度有限;模拟环境的 OOD 鲁棒性提升能否泛化到更多样化的实体机器人、灵巧手或移动操作场景仍有待检验。作者未在完全未见的物体类别上评估视觉概念保持。