论文

CARE: 面向 Vision-Language-Action 策略的经验引导原子纠错执行

CARE: 面向 Vision-Language-Action 策略的经验引导原子纠错执行

Vision-Language-Action (VLA) 策略在机器人操作上表现优异,但一旦执行偏离名义轨迹就会变得脆弱。CARE 框架(Corrective Atomic Robotic Execution)通过从执行中遇到的失败里学习,来提升策略的恢复能力。 不同于从人工设计或随机扰动生成纠错数据,CARE 收集失败 rollout,建模 阶段条件化的失败后偏差,并用得到的经验分布合成有代表性的失败状态与纠错示范。推理阶段,CARE 将阶段式规划与具备物理依据的 3D 监控结合,在保持任务进度的同时触发原子调整或重操作。 为评测恢复能力,作者提出 FSR-Bench,即 Failure State Recovery Benchmark,考察在局部偏差与结构异常下从中间失败状态恢复的表现。在多种 VLA 主干、仿真基准和真实双臂任务上,方法均取得一致提升:仿真平均任务成功率提高 14.5 点,真实世界提高 15.9 点。代码、模型与数据见 https://github.com/xiaojunlan/care

论文精读

TL;DR CARE 从执行失败中学习纠正策略,通过经验引导合成失败状态和纠正演示,结合阶段规划与 3D 监控实现原子级恢复,在仿真和真实双臂任务中显著提升成功率。

问题

问题背景

VLA 策略在机器人操作任务中已取得显著性能,但执行一旦偏离标称轨迹,系统通常表现出脆性失效。当前研究聚焦于提升策略在中间失败状态下的恢复能力。

现有方法局限

  • 纠正数据合成方式:多数自我纠正系统依赖人工设计扰动或随机扰动生成纠正样本,此类扰动分布与真实部署中遭遇的失败模式存在显著失配,导致模型在 intermediate failure states 上的泛化不足。
  • 恢复控制粒度:常见方案采用全局重规划或完整重试,缺少 stage-conditioned 的原子级调整,容易丢失已完成的子任务进度,降低整体效率。
  • 评估协议缺失:缺少针对中间失败状态恢复的专用基准,难以系统比较不同方法的鲁棒性。

为什么难/重要

失败模式呈现高维非线性特征,局部偏差(如抓取偏移)与结构异常(如物体错位)并存,难以用固定规则覆盖。从经验中学习需要建模 stage-conditioned post-failure deviations,从有限失败样本中估计分布并合成代表性纠正数据,统计复杂度高。真实机器人任务长程且代价昂贵,在线恢复策略直接决定部署成功率与任务完成效率,因此工业界与学术界均高度关注。

行业类比

类似自动驾驶中的车道保持恢复:车辆偏离车道后,系统执行局部转向纠正回到车道,而不是重新规划全程路径,以保持任务连续性与安全性。

核心洞察

  • **经验引导的纠正数据合成**:CARE 不从预定义扰动或随机噪声生成纠正数据,而是从实际失败 rollout 中学习后失败偏差的经验分布,并合成代表性失败状态和纠正演示。这种数据驱动方式使训练数据更贴合真实失败模式,避免随机扰动产生的无效或极端状态,同时更高效地覆盖高价值纠正场景。与依赖手工规则或均匀随机扰动的基线相比,CARE 的数据合成具备阶段条件化特性,显著提升 VLA 策略在中间失败状态的恢复能力。
  • **原子纠正执行框架**:CARE 在推理时采用阶段级 VLM 规划与 3D 几何监测,触发细粒度的原子调整或重操作,而非整体重规划或简单重试。该框架保留已完成阶段的进度,仅针对偏差局部介入,避免冗余操作和误差累积。与现有自我纠正系统相比,CARE 将全局任务分解为阶段,以物理可观测的 3D 状态作为触发条件,使纠正动作更精准、更安全,适合长程操作任务中的在线恢复。
  • **FSR-Bench 基准**:CARE 提出 Failure State Recovery Benchmark(FSR-Bench),专门评估从中间失败状态(局部偏差和结构异常)恢复的能力。现有基准多关注标称轨迹下的成功率,忽略了执行中段偏离后的恢复表现。FSR-Bench 通过设计训练与测试分布分离,测试策略在未见失败状态下的泛化恢复能力,为社区提供了一个更具现实意义的评估协议,推动 VLA 鲁棒性研究从“避免失败”转向“失败后恢复”。

方法

方法概述

输入:预训练 VLA 策略、离线收集的失败轨迹、任务 stage 划分、3D 几何感知信息。

关键模块

  1. Experience-Guided Corrective Data Synthesis:
    • 收集失败 rollout,按 stage 切分;对每个 stage 后出现的失败偏差进行经验建模(Failure Modeling),得到阶段条件的偏差分布。
    • 从分布中采样代表性失败状态,并自动合成原子级 corrective demonstrations(Corrective Data Synthesis),用于后续微调 VLA 策略。
  2. Atomic Corrective Execution Framework:
    • VLM Planner:离线/在线提供 stage-wise 任务规划,将长程任务拆解为多个阶段。
    • 3D Geometric Monitor:基于物理 3D 几何信息实时判断当前状态是否偏离预期,并触发原子调整(intra-execution adjustment)或阶段重操作(post-stage re-operation)。
    • VLA Executor:执行原子动作或重操作,同时保留已完成阶段的任务进度。

同时提出 FSR-Bench 基准,专门评估从中间失败状态恢复的能力,覆盖局部偏差与结构异常。

输出:经过纠正数据微调后的 VLA 策略,以及在 FSR-Bench 上的成功率指标。

跟同类方法的差异点:CARE 不依赖手工设计或随机扰动生成纠正数据,而是从真实失败轨迹中学习经验偏差分布,并以原子动作粒度进行修正,减少对任务进度的破坏。

实验

实验设计

CARE 在多个 VLA 骨干 上进行评估,覆盖模拟基准(包括 FSR-Bench)与真实世界双机械臂任务。实验采用两阶段流程:先从执行失败的 rollout 中收集数据,建模 stage-conditioned 后验偏差分布,合成代表性失败状态与纠正演示;再以 VLM 规划器 + 3D 几何监控 + VLA 执行器 的原子纠正框架,在推理时触发局部调整或阶段重操作,保留已成功的任务进展。基线与原始 VLA 策略及典型自纠正变体对比。

关键发现

  • 模拟环境平均任务成功率提升 +14.5 pp,真实世界提升 +15.9 pp,且跨不同 VLA 骨干表现一致。
  • 在 FSR-Bench 的局部偏差与结构性异常故障状态下,CARE 的恢复成功率显著改善,证明经验引导的纠正数据比随机扰动更贴近实际失败分布。
  • 消融实验表明,3D 几何监控 的事件触发机制能有效避免不必要干预,原子调整 比整任务重试保留更多进展。

与基线对比解读

与依赖人工设计扰动或随机噪声生成纠正数据的自纠正方法不同,CARE 从真实执行失败的 经验分布 中采样,纠正演示更具代表性。同时,原子级执行 通过最小操作单元修复偏差,避免完全重新规划,使恢复效率与成功率同步提升。这一设计在长时程操作任务中尤其有价值,强化了 VLA 策略在实际部署中的鲁棒性。

行业影响

落地场景

CARE 适合 仓储 / 物流分拣机器人、实验室自动化移液 / 抓取、服务机器人末端操作 等长程操作场景。例如电商仓库中机械臂抓取商品时因包装形变或夹具打滑偏离轨迹,CARE 在执行中触发原子级纠正,无需全局重规划;医疗 / 生科实验室的液体处理机器人在样本管错位时自动重操作,避免批次报废。

商业价值

  • 降本:仿真与真实任务成功率分别提升 14.5 / 15.9 个百分点,减少人工干预与物料浪费;故障恢复无需重建整条轨迹,降低停机时间。
  • 增收 / 体验:电商履约中提高每小时订单处理量;实验室场景减少重复实验批次,缩短交付周期。
  • 相比随机扰动或手工设计的纠正数据,CARE 用真实失败经验建模偏差,更贴合实际,部署后维护成本更低。

与现有产品/工作流接口

CARE 作为 VLA 策略的后训练恢复层,可接入 ROS 2 / Isaac Sim:

  1. 离线收集失败 rollout,训练阶段条件偏差模型与 VLM 规划器;
  2. 在线由 3D 几何监控器 事件触发,调用 VLA 执行器 做原子调整或阶段重做,不打断已完成子任务;
  3. 已有 VLA 产品(如 OpenVLA / RT-2)仅需替换执行与监控模块,无需修改基础模型权重,适合插件式部署到现有机器人控制软件。

局限

  • **数据合成依赖失败经验**,CARE 的纠正数据生成需要先收集失败 rollout。在真实机器人上,主动制造失败可能带来安全风险或成本,而随机扰动产生的失败不一定符合实际部署中的偏差模式。论文未讨论如何在低成本下高效获取高质量失败样本,也未验证当可用失败数据很少时框架的鲁棒性。此外,基于经验分布建模后合成代表性状态,可能忽略罕见但关键的复合故障,导致恢复策略在长尾场景失效。
  • **系统复杂度显著增加**。CARE 在推理阶段引入 VLM planner 与 3D geometric monitor,两者均为独立模块且需要协同。VLM 的推理延迟、3D 监控的标定误差和事件触发阈值设置都会影响整体恢复效果。论文的消融虽涉及监控机制,但未分析实时性开销(如每秒帧率)或在低算力平台上的可行性。与端到端 VLA 相比,多模块串联带来更多超参数和工程维护成本,可能限制在资源受限场景的部署。
  • **评估范围有限**。FSR-Bench 虽然针对中间失败状态设计,但训练和测试分布均来自受控扰动;真实世界实验仅覆盖双机械臂的少数任务,且未报告长期连续运行的稳定性。论文主要用任务成功率衡量恢复能力,缺少对恢复时间、动作次数或能耗效率的评测,而这些指标在实际部署中同样重要。同时,与现有自纠正方法(如基于语言反馈的 Reflexion)对比不足,难以定位 CARE 的独特优势边界。
论文Junlan Xiao2026-09-21原文

相关内容