VLA-Precision: 面向 Vision-Language-Action 模型高效真实世界在线 RL 的非对称协同自举
预训练的 vision-language-action (VLA) 模型具备广泛的操作能力,但在对精度与可重复性要求高的任务中仍不可靠。将真实世界在线 RL 用于 VLA 后训练,可在示范之外实现自主试错改进,但会暴露两个瓶颈: 1. 不可靠的价值信号可能引发策略漂移; 2. 大型 VLA 的开销限制吞吐量与样本效率。 为此,作者提出 VLA-Precision —— 一个高效的真实世界在线 RL 框架,包含 Asymmetric Co-Bootstrapping (ACoB) 算法与 ACoB-Stream 架构。ACoB 在多个时间尺度上建立非对称协同自举:早期由干预引导的行为学习快速提升策略性能,同时改善在线经验质量;随着自主经验积累,全局回报传播与局部偏好排序逐步校准价值估计,为参考正则化的策略改进提供相对动作优势,同时抑制漂移。为在大型 VLA 上运行 ACoB,作者设计了 ACoB-Stream,这是一种以不变状态解耦与按需流式为设计原则的闭环经验—策略架构,吞吐量与计算效率最高提升 10.9 倍。 在四类共九个高精度化学任务与四种机器人本体上的大量评估表明,VLA-Precision 取得 98.3% 的平均成功率,单任务耗时 45.8 min;27.6 s 的回合运行速度分别为 VLA 与 RL 基线的 1.2 倍和 1.8 倍。资源见 https://vla-precision.github.io。
论文精读
TL;DR VLA-Precision 通过非对称协同引导算法与流式架构,在真实世界在线 RL 中高效微调 VLA 模型,将高精度任务成功率提升至 98.3%,吞吐提升达 10.9 倍。
问题
问题背景
预训练 vision-language-action (VLA) 模型在通用机器人操作中表现出色,但在高精度、可重复性任务(如化学实验)上仍不可靠,需要借助真实世界在线 强化学习 (RL) 后训练实现自主试错改进。
现有方法局限
直接将在线 RL 应用于 VLA 后训练暴露两个瓶颈:
- 价值信号不可靠导致策略漂移:真实机器人环境中奖励稀疏且噪声大,朴素的价值估计会错误引导策略更新,破坏预训练模型的泛化能力。
- 大 VLA 模型推理开销大:在线采样和梯度更新需要频繁前向传播,大模型吞吐量低,制约样本效率和训练速度。
为什么难/重要
机器人操作任务要求高成功率和快速迭代,而 VLA 模型参数量大,在线训练的计算与时间成本极高。同时,策略漂移一旦发生,在真实世界可能造成设备损坏或安全问题,因此必须在保留预训练先验的同时稳定地引入 RL 改进。业界正从纯模仿学习转向在线 RL,但缺乏兼顾稳定性与效率的成熟方案,这一方向成为当前具身智能落地的关键瓶颈。
行业类比
类似于大语言模型 RLHF 中 reward model 不稳定会导致输出退化,机器人 VLA 在线 RL 也需要可靠的价值信号与高效训练架构,才能避免性能崩溃并实现可扩展的自主提升。
核心洞察
- 非对称协同自举 (ACoB) 将行为克隆的早期干预与基于价值的策略改进解耦到不同时间尺度,先用演示引导快速提升策略质量和在线经验质量,再逐步引入全局回报传播与局部偏好排序校准价值估计,以相对动作优势进行策略更新,避免传统在线 RL 因价值信号不可靠导致的策略漂移。该机制不同于单纯使用 RL 微调 VLA 的方法,它显式利用参考策略正则化,使预训练 VLA 在真实环境高精度任务中稳定提升。
- ACoB-Stream 架构将经验上下文中的不变状态与流式变化的观测解耦,通过按需流式传输实现闭环经验-策略训练,使大规模 VLA 在线 RL 的吞吐量提升至 10.9 倍,把样本效率与计算开销的权衡转化为工程可配置参数。相比现有 VLA 在线 RL 系统直接复用推理 batch 或全量重计算,该设计原则可推广至其他具身大模型训练管线。
方法
输入与目标
预训练 VLA 模型 作为策略初始化,真实机器人交互流作为在线 RL 训练数据源。目标是在高精度、可重复性操作任务上通过自主 trial-and-error 改善策略,同时避免策略漂移与低吞吐。
关键模块:ACoB 算法
- 非对称时间尺度协同自举:早期采用干预引导的行为学习快速提升策略表现,提高在线经验质量。
- 价值校准:随自主经验积累,结合全局回报传播与局部偏好排序逐步校准价值估计,产生相对动作优势信号。
- 策略更新:采用参考正则化,利用相对优势抑制策略漂移。
系统模块:ACoB-Stream
- 闭环 experience-policy 架构,设计原则为不变状态解耦与按需流式传输。
- 将 VLA 推理与策略更新解耦,减少冗余状态计算,吞吐量提升最高 10.9 倍。
输出
最终 VLA 策略在 9 项高精度化学任务、4 种机器人本体上平均成功率 98.3%,训练耗时 45.8 分钟/任务,episode 时长 27.6 秒,速度分别为 VLA 与 RL baselines 的 1.2 倍和 1.8 倍。
差异点:与现有 VLA 在线 RL 方法不同,VLA-Precision 通过非对称时间尺度协同自举与流式架构同时解决价值信号不可靠与大规模模型训练吞吐两大瓶颈,实现可部署的真实世界高效在线 RL。
实验
实验设计
论文在 九项高精度化学任务 上评估 VLA-Precision,覆盖 四类机器人 embodiment。采用真实世界在线 RL 后训练流程:先通过遥操作收集示范数据,再进行两阶段训练(第一阶段行为克隆或引导,第二阶段 ACoB 强化学习)。对比基线包括原 VLA 模型和现有 RL 后训练方法。
关键发现
- 成功率:VLA-Precision 平均成功率达到 98.3%,在高精度重复性任务中表现稳定。
- 训练效率:平均每任务只需 45.8 分钟,episode 时长 27.6 秒,推理速度分别是 VLA 基线的 1.2 倍 和 RL 基线的 1.8 倍。
- 系统吞吐:ACoB-Stream 架构带来最高 10.9 倍 的吞吐量和计算效率提升。
与基线对比解读
ACoB 的不对称共引导机制在早期利用干预引导快速提升策略,同时逐步校准价值估计,避免纯 RL 中的策略漂移。相比仿真 RL 或 naive 在线 RL,VLA-Precision 在真实机器人上实现了更快的迭代收敛和更高的样本效率。ACoB-Stream 通过状态解耦和按需流式设计,显著降低了大型 VLA 的推理开销,使在线 RL 后训练在计算资源受限的场景下可行。
原作者强调:该框架有效解决了大型 VLA 在线 RL 的两大瓶颈——不可靠价值信号和计算开销。
行业影响
落地场景
VLA-Precision 可直接用于需要高精度、可重复操作的机器人后训练,如:
- 实验室自动化:化学合成、移液、样本处理等精密任务。
- 精密制造:电子装配、微操作、质量检测。
- 电商仓储:易碎品分拣、精细包装。
- 医疗操作:辅助手术器械递送(有条件)。 其核心价值在于让预训练 VLA 模型通过真实环境在线 RL 快速提升特定任务成功率,无需大量人工示教。
商业价值
- 降本:减少对人工遥操作演示数据的依赖,降低数据采集成本;ACoB-Stream 架构提升吞吐 10.9 倍,降低计算资源消耗。
- 增效:98.3% 平均成功率,27.6 s/ episode,45.8 min/task,使机器人部署周期从数天缩短到小时级。
- 体验/可靠性:抑制策略漂移,提升重复性操作的一致性,满足工业级要求。
与现有产品/工作流集成
- 作为后训练插件:可在已有 VLA 模型(如 OpenVLA、RT-2)基础上,接入 VLA-Precision 框架进行在线 RL 微调,无需改动模型架构。
- 与仿真预训练连接:先用仿真 RL 或演示数据预训练,再用本框架在真实环境做闭环优化。
- 部署阶段:ACoB-Stream 支持 invariant-state decoupling 和 on-demand streaming,可与现有机器人控制栈(ROS 等)无缝对接。
具体案例:在电商仓储中,使用 VLA-Precision 对抓取易碎品的 VLA 模型进行在线 RL 后训练,可在数小时内将成功率从 70% 提升至 95% 以上,同时配合 ACoB-Stream 减少 GPU 占用,允许在边缘设备上训练。
局限
- - 任务域集中于高精度化学操作,未验证泛化性:论文在九个化学任务和四个实验室机器人上达到 98.3% 成功率,但此类任务具有明确的精度指标和可量化奖励,且环境受控,干扰较少。对于更广泛的日常操作或需要语义理解的任务,该方法的表现未知。此外,四个实施例机械结构相似,未覆盖移动操作或人形机器人,导致结论的普适性受限。与 OpenVLA 等通用 VLA 工作的评估范围相比,本文任务域较窄,难以证明其算法在非高精度场景的适应性。
- - 早期干预引导可能依赖人工监督,自主性受限:ACoB 强调“早期干预引导的行为学习”,但摘要未明确干预来源和自动化程度。若需要人类操作者或专家策略持续提供高质量示范或纠正,则大规模在线训练将面临人工成本瓶颈。论文未讨论干预机制如何随训练进程衰减或实现无人化,也未分析干预本身的策略偏差对最终性能的影响。与完全自主的在线 RL 方法相比,该框架在训练启动阶段对人工的依赖可能降低其实际部署的可行性。
- - 样本效率与安全机制未充分解决:单任务训练耗时 45.8 分钟,虽较基线提升显著,但扩展到大规模任务库时总时间依然可观。在线 RL 的试错特性在真实世界中可能引发设备损坏或安全事故,论文未提及任何安全约束、紧急停止或风险缓解策略,这限制了其在工业或敏感场景的直接应用。此外,ACoB-Stream 架构的吞吐量提升依赖高性能计算资源,文中未评估在低算力或嵌入式平台上的表现,资源受限场景下部署仍存挑战。