论文

驯服机器人执行误差下的 VLA:自补偿与压力测试

驯服机器人执行误差下的 VLA:自补偿与压力测试

VLA (vision-language-action) 策略在机器人实际执行的运动偏离指令动作时往往失效。这类执行误差 源于机器人机械结构与运行条件,例如磨损和负载变化。 我们提出 self-compensating VLA,一种部署期自适应方法:让 VLA 策略在生成指令时预先补偿机器人的执行误差。该方法无需任务奖励或标签,直接利用 VLA 下达的动作与机器人实际执行运动之间的残差 在线更新策略。 为在物理机器人难以覆盖的执行条件下对 VLA 鲁棒性进行压力测试,我们提出 RoboStress,一个可控仿真基准。它将关节级的摩擦、回差、柔顺性与重力补偿误差模型组合成七种部署场景,其执行误差取决于机器人状态与运动历史。 在 RoboStress 上,self-compensating VLA 的平均任务成功率高于基础策略以及在训练阶段内置鲁棒性的方法。在两台使用历史不同的实体机械臂上,该方法将每台机械臂的平均任务成功率提升超过 30 个百分点,且增益可泛化到任务演示中未见的物体。

论文精读

TL;DR 提出 self-compensating VLA,部署时仅用命令-执行残差在线补偿机器人执行误差,无需任务奖励;配合 RoboStress 仿真基准,在真实机械臂上任务成功率提升超 30 个百分点。

问题

问题背景

VLA(Vision-Language-Action)模型将视觉、语言与动作生成统一到单一策略中,显著提升了机器人操作的泛化能力。然而,实际部署时机器人机械系统的执行误差(例如关节摩擦、齿隙、柔顺性、重力补偿误差)会导致真实运动偏离 VLA 输出的指令动作,使得策略在仿真或理想条件下表现良好,一到真实机器人上成功率骤降。

现有方法局限

以往提升 VLA 鲁棒性的思路多集中在训练阶段:通过领域随机化、注入扰动或对抗训练,让策略在训练时见过更广的误差分布。但这类方法存在两个关键局限:

  1. 误差分布难以穷尽:真实执行误差是状态相关且历史相关的,例如关节摩擦随温度、磨损和负载变化,齿隙取决于运动方向切换,单纯在训练时采样固定噪声很难覆盖所有部署条件。
  2. 策略固定无法自适应:训练完成后策略参数冻结,部署时无法根据当前机器人的实际执行残差进行在线修正。部分工作尝试在部署时辨识系统参数或使用自适应控制,但通常需要显式的动力学模型、任务奖励或额外标签,难以与大规模 VLA 策略无缝结合。

为什么这个问题难/重要

核心挑战在于:执行误差不是简单的加性噪声,而是随机器人状态(关节角度、速度)和运动历史(方向反转、持续负载)动态变化,直接在线学习一个补偿映射极易导致策略震荡或遗忘原有能力。本文提出的自补偿 VLA 利用动作命令与实际执行运动之间的残差作为自监督信号,在 LoRA 子空间更新策略,无需任务奖励或标签,实现了部署时的轻量在线补偿。同时,RoboStress 基准通过组合摩擦、齿隙、柔顺性、重力补偿误差建立七个部署场景,为 VLA 鲁棒性提供了可控、可复现的评估手段。该问题直接关系到 VLA 从实验室走向真实产线的可靠性,业界关注度极高。

行业类比

类似于自动驾驶中传感器标定漂移导致规划轨迹与车辆实际执行产生偏差,若不做在线补偿,再先进的感知与决策模型也会性能骤降;本文的残差驱动在线修正思路可迁移至各类具身智能系统。

核心洞察

  • 自补偿 VLA 将执行残差作为部署时在线学习的唯一监督信号,使策略能够针对当前机器人的执行误差进行预补偿。不同于训练时注入噪声或建立精确动力学模型的方法,它直接利用命令动作与实际运动之间的残差,通过 LoRA 微调更新策略,无需任务奖励或标签。这种闭环适应机制能应对随状态和运动历史变化的误差(如摩擦、齿隙),在真实机械臂上平均提升 30 个百分点以上,且泛化到演示中未见的物体。
  • RoboStress 是一个受控仿真基准,通过组合关节级摩擦、齿隙、柔顺和重力补偿误差模型,生成七种部署场景,其执行误差依赖于机器人状态和运动历史。这为 VLA 鲁棒性提供了可复现、可扩展的压力测试环境,弥补了物理机器人测试成本高、场景覆盖有限的不足。实验表明,在 RoboStress 上自补偿 VLA 优于基线和训练时鲁棒化方法,验证了部署时适应相对于离线鲁棒化的优势。

方法

方法概述

Self-Compensating VLA 是一种部署时在线自适应方法,目标是让 VLA 策略在生成命令时主动补偿机器人执行器的机械误差(如摩擦、齿隙、柔顺性、重力补偿误差)。

输入:VLA 策略当前输出的 commanded_action,以及机器人实际执行的 executed_motion。两者之间的残差(residual = commanded_action - executed_motion)构成自监督补偿信号,无需任务奖励或外部标注。

关键模块:

  1. 残差计算:利用机器人关节编码器或运动学观测,实时获取执行后的实际运动,与策略原始命令对齐后计算残差;该残差反映了执行器在特定状态和历史下的系统性偏差。
  2. 在线策略更新:在部署过程中,以残差为优化目标对 VLA 策略的部分参数(如 LoRA 适配器)进行轻量更新。结合 flow-matching 风格的目标变换或直接回归残差来调整动作生成分布,使策略学会“预补偿”:当预期机器人向左偏时,策略命令会适度向右修正。
  3. 锚点正则(Anchor Loss):为保持基础策略的语言理解和通用能力,加入锚点损失约束更新后的策略不要偏离原始策略过远。

输出:一个新的、针对当前部署环境和机器人状态的 VLA 策略,其生成的命令在物理执行后更接近任务所需的实际运动,从而提升成功率。

与同类方法的差异点:不同于在训练阶段注入噪声或域随机化来增强鲁棒性的方法,Self-Compensating VLA 在部署时利用真实执行残差在线适应,无需重新训练或奖励信号,从而能针对每台机器人的磨损历史和负载变化进行个性化补偿。

实验

实验设计

  • 基准:RoboStress 仿真基准,包含七种部署场景,基于关节级摩擦、间隙、柔顺、重力补偿误差等模型,模拟真实机器人随磨损、负载变化产生的执行误差。
  • 方法对比:self-compensating VLA vs 基础 VLA 策略 vs 训练期内构建鲁棒性的方法。
  • 物理验证:在两个不同使用历史的物理机器人臂上测试,任务成功率为核心指标,并评估对未见物体的泛化。

关键发现

  • self-compensating VLA 在 RoboStress 上平均任务成功率高于所有基线(基础策略、训练时鲁棒方法)。
  • 在两个物理机器人臂上,平均任务成功率提升超过 30 个百分点,且泛化到演示中未见的物体。
  • 方法无需任务奖励或标签,仅利用 VLA 指令与实际执行运动之间的残差在线更新策略。

对比解读

  • 与训练时鲁棒性方法不同,self-compensating VLA 在部署阶段适应具体机器人实例的执行特性,无需大规模鲁棒训练数据或仿真到现实的 gap。
  • 工程启示:对于长期部署、硬件状态漂移的场景,部署时在线自补偿能以较低成本维持性能;适合与 LoRA 等参数高效微调结合,避免完整重训。

行业影响

落地场景

自补偿 VLA 主要适用于 工业机器人、仓储物流机器人 与 服务机器人 的长期部署。当机器人因关节磨损、负载变化或重力补偿偏差导致实际运动与指令不一致时,该方法无需重新采集数据或人工标注即可在线修正策略。

  • 场景一:电商仓储分拣 —— 机械臂在抓取不同重量包裹时,负载变化会引入执行误差,自补偿可维持抓取成功率。
  • 场景二:3C 电子装配 —— 精密装配中关节摩擦与回差累积影响定位精度,部署时在线补偿能减少因机械状态漂移导致的停线调试。

商业价值

降本 为主:减少因执行误差造成的任务失败与人工干预,避免频繁重新标定或重新训练策略;同时延长机械臂在非理想状态下的可用周期,降低维护与停机成本。体验提升 体现在服务机器人(如送餐、导引)面对不同负载时动作更稳定,减少碰撞或掉落。

与现有产品/工作流接口

该方法可集成到 现有 VLA 推理管线:在动作输出端增加一个轻量级残差估计模块,利用机器人关节编码器反馈与命令动作的差值计算补偿信号,通过 LoRA 等参数高效微调在线更新策略。无需修改底层控制器,但需要机器人开放实时关节状态反馈。对于已部署 OpenVLA、RT-2 等模型的团队,可以以插件形式接入,作为 部署时鲁棒性增强层。

实际部署时建议结合 RoboStress 基准做压力测试,先离线评估不同故障场景下的补偿效果,再上线在线适应。

局限

  • 论文主要关注关节级执行误差(如摩擦、反向间隙、柔顺与重力补偿误差),未涉及传感器噪声、视觉感知误差或环境不确定性,而实际部署中这些因素常与执行误差耦合,可能削弱补偿效果。此外,方法依赖准确的关节状态与动作残差测量,若机器人缺乏高精度编码器或外部运动捕捉,残差信号中的噪声可能导致策略更新不稳定。此局限限制了方法在低成本或低精度平台上的直接应用。
  • RoboStress 提供了可控仿真,但关节级模型(如 Stribeck 摩擦、齿隙、柔顺)可能无法完全复现真实机械臂的复杂动态,包括温度漂移、关节磨损随时间演变及多关节耦合效应。物理实验仅在两条不同使用历史的机械臂上进行,样本量小,且未在不同机器人型号、负载条件或任务类型(如力控任务)下验证,因此结论的泛化性仍待进一步检验。
  • 在线更新引入额外计算开销,对于高实时性操作(如动态抓取、快速装配)存在挑战。方法假设执行误差在部署期间缓慢变化或恒定,对于突发性故障(如关节卡死、连杆断裂)或快速时变负载可能难以快速适应。此外,需要持续采集动作残差,可能需要在机器人运行过程中保持外部测量或额外标定,增加了部署复杂度。
论文Sohyun Lee2026-09-29原文

相关内容