论文

PolicyTrim: 提升视觉-语言-动作模型的内在策略效率

PolicyTrim: 提升视觉-语言-动作模型的内在策略效率

视觉-语言-动作 (Vision-Language-Action, VLA) 模型为机器人操控提供了统一范式,但其实际部署常受执行效率瓶颈制约。现有工作主要聚焦于计算效率以降低单步推理延迟,而内在策略效率却鲜有探索。策略效率受两个因素影响:预测动作块的有效可执行长度,以及完成任务所需的总物理步数,二者共同决定执行过程中的前向推理调用次数。 针对当前VLA策略存在规划不可靠性和动作冗余的问题(动作块尾部预测严重退化,且常生成不必要冗余物理步),本文提出PolicyTrim——一种基于强化学习的后训练框架,用于扩展可靠动作块长度、减少冗余物理步。具体而言: - 可靠块扩展:采用动态探索策略,显式奖励成功完成更长可执行长度,逐步将可信预测范围推至经验极限。 - 步效率优化:设计冗余感知奖励,直接奖励用更少步数成功完成任务,同时惩罚不可复现的捷径,有效消除冗余物理动作。 在三个基准和三个VLA模型上的广泛实验表明,PolicyTrim将动作块利用率提升3倍,物理执行步数减少51.4%,最终实现高达5.83倍的端到端部署加速,且不影响任务成功率。

论文精读

TL;DR PolicyTrim 用强化学习后训练延长 VLA 模型的可靠动作块长度并削减冗余物理步骤,实现最高 5.83 倍端到端部署加速且不损失成功率。

问题

问题背景

Vision-Language-Action (VLA) 模型为机器人操控提供了统一的感知‑规划‑执行范式,但其在真实场景部署时往往受限于执行效率。目前多数工作聚焦于计算中心效率,如通过模型压缩或算子优化降低单步推理延迟;然而,决定端到端推理总次数的内在策略效率尚未被充分探索。

现有方法的局限

当前 VLA 策略存在两大核心缺陷:

  • 规划不可靠:预测的动作块(action chunk)只在序列前端质量较高,尾部预测严重退化,导致可实际执行的连续动作长度远低于理论块长,被迫频繁调用推理来更新规划。
  • 动作冗余:策略倾向于生成不必要的物理步骤,即使任务已接近完成,仍会执行多余动作,造成 forward 调用的浪费。

这两类问题在现有的 VLA 训练范式中难以通过单纯的监督学习克服,因为缺乏对“高效执行”的直接激励,且没有机制区分必要步骤与冗余动作。

为什么该问题重要且困难

重要性:减少推理总次数直接决定部署吞吐与资源消耗,尤其在边缘设备或多任务并行场景下,策略效率提升可与计算加速叠加,带来数倍的端到端提速,且不牺牲成功率。

技术挑战

  1. 可靠执行长度扩展:需奖励模型生成更长的可执行序列,但过长的预测可能超出模型容量,导致失败;因此必须动态探索每个策略的可靠边界。
  2. 冗余感知的步数减少:不能简单惩罚所有步数,否则模型可能学到不可复现的捷径(如利用环境特定动力学),导致泛化能力崩溃。

这两点要求在探索与稳定性之间取得平衡,很难通过固定超参或规则实现。

业界关注度:随着 VLA 模型向实时操控落地,推理效率已成为工程化的核心瓶颈,类似大语言模型领域对 推理延迟和吞吐的极致优化,机器人社区对策略效率的需求同样急迫。

行业类比

这类似于大模型推理中的 投机采样 —— 通过让模型生成更长的可靠 token 序列来降低总解码次数;PolicyTrim 则是让机器人策略产生更长的可靠动作块,从而减少规划‑执行循环的迭代次数。

核心洞察

  • **政策效率不应只关注计算延迟,而应直接优化推理调用次数**:VLA 模型在执行中需要多次前向推理,PolicyTrim 从动作序列规划角度切入,通过延长有效动作块长度和减少冗余物理步骤来降低总推理调用数。这一视角与常规的计算加速(模型量化、剪枝、投机解码)正交,且效果显著(推理调用减少约 5.8 倍)。
  • **动态探索可靠动作块边界是解开尾部预测退化的关键**:固定动作块长度的 VLA 策略常常在动作块末端产出不可靠预测,导致执行失败或浪费。PolicyTrim 用动态执行时间探索策略,显式奖励成功完成更长动作块,逐步向外推进可信预测范围,将动作块利用率提升 3 倍。这种基于 RL 的逐次扩展不同于简单的超参搜索,能够根据任务动态调整。
  • **冗余感知奖励引导减少步数同时防止不可复现捷径**:简单奖励步数少可能导致模型采取不稳定的策略,而 PolicyTrim 的冗余感知奖励不仅鼓励更少步骤完成任务,还通过群组锚定正则化惩罚那些难以复现的“偶然成功”,确保步数压缩是稳健的。这使得物理步骤减少 51.4% 的同时,成功率不降。

方法

方法概述

PolicyTrim 是一种基于 强化学习的后训练框架,旨在提升 VLA 模型的 内部策略效率。不同于优化单步推理延迟的算力中心方法,PolicyTrim 通过减少任务执行所需的总推理调用次数来加速端到端部署。

输入:已预训练的 VLA 策略(如 OpenVLA、Octo 等),以及机器人操作任务环境。

关键模块

  1. 可靠动作块扩展
    采用 动态探索策略,在交互中逐步增加动作块执行长度。智能体尝试执行预测出的整个动作序列(action chunk),只有完全成功执行才获得奖励。这使得策略主动延长可靠预测范围,缓解尾部动作退化问题。

  2. 冗余感知步数减少
    设计并施加以 冗余感知奖励:任务成功完成时,根据实际消耗的物理步数给予奖励,步数越少奖励越高;同时引入正则化惩罚不可复现的“捷径”,避免策略学习脆弱的高效轨迹。

输出:优化后的 VLA 策略,其动作块利用率提升 3 倍,物理执行步数减少 51.4%,最终端到端部署速度提升最高 5.83 倍,且任务成功率不下降。

与同类方法差异:现有高效 VLA 工作集中在模型压缩、量化等算力中心手段,而 PolicyTrim 首次从 策略效率 维度切入,通过 RL 后训练直接提升策略生成动作的可执行性与精简度,无需修改模型结构。

实验

实验设计概述

PolicyTrim 在 3 个机器人操作基准LIBEROManiSkillMeta-World)上评估 3 个主流 VLA 模型,覆盖多种任务复杂度与动作空间。实验采用 强化学习后训练,不修改模型权重或架构,仅引入 动态探索策略冗余感知奖励。训练过程中,环境以不同执行长度展开动作块,模型根据是否成功完成更长序列获得奖励,同时被鼓励以更少物理步数达成目标。除主实验外,还包含 消融分析(各组件贡献、分组效应等)、真实机器人部署 验证、视觉扰动鲁棒性测试及架构泛化性检验。

关键发现

  • 动作块可靠性大幅延伸:未优化 VLA 在动作块尾部显著退化,PolicyTrim 使 有效可执行长度 提升至原来的 3 倍,大幅减少整体前向推理次数。
  • 物理步骤冗余消除:引入的 冗余感知奖励 直接优化完成任务所需步数,平均减少 51.4% 的物理执行步数,同时避免不可复现的捷径。
  • 端到端部署速度飞跃:合并两项优化后,推理调用次数锐减,总体加速比高达 5.83 倍,且任务成功率无显著下降,部分任务成功率甚至略有回升。
  • 跨架构与跨任务泛化:PolicyTrim 在不同 VLA 主干网络上均表现出一致增益,表明其优化的是 策略内在效率,而非依赖特定模型结构。

基线对比深度解读

现有 VLA 效率研究多聚焦于 计算中心优化(如模型剪枝、量化、推理加速),而忽略了 策略层面的低效:动作块预测的尾部坍塌和不必要的微动冗余。PolicyTrim 直接针对这两项根因,通过 RL 信号重塑策略行为,正交于任何计算加速。与未优化基线相比,它不止是 “快”,而是让策略本身更“聪明”地规划:同样的任务,执行更少的动作且每个动作块都更可靠。实验还表明,单纯减少步数(如固定更短的动作块)会损害成功率,而 PolicyTrim 的 分组锚定正则化动态探索 在扩展可靠长度的同时避免了退化。这种从策略质量出发的效率提升,为 VLA 的现实部署提供了一条高性价比的路径,且可与现有计算加速方法叠加,进一步释放性能潜力。

行业影响

机器人操作场景的即时泛化性

PolicyTrim 作为 VLA 模型后训练框架,直接适用于各类基于视觉-语言-动作范式的机器人操作场景,无需修改模型架构。典型落地场景包括:

  • 自动化仓储物流:分拣、上架、码垛等多步操作,减少无效试探动作,提升单日吞吐量。
  • 精密装配与维护:如电子元件插装、机械臂检修,要求动作序列精准可靠,PolicyTrim 能压缩无用步骤,降低误操作风险。
  • 服务与协作机器人:餐饮递送、医疗物品整理等,减少冗余物理移动可提升服务密度,并降低碰撞概率。
  • 自动驾驶末端执行:充电枪插拔、物流车装卸等场景,稳定执行短动作序列可提高设施周转率。

商业价值:降本与增效的直接挂钩

PolicyTrim 的核心贡献是在不降低任务成功率的前提下,将端到端部署速度提升最多 5.83 倍,这直接转化为:

  • 硬件成本摊薄:同一时间窗内完成更多任务,降低单次操作摊销的计算/机器人硬件成本。
  • 能源与推理成本:将有效动作块利用率提高 3 倍,物理步骤减少 51.4%,大幅减少模型推理调用次数,节约 GPU/边缘设备算力与功耗。
  • 服务等级提升:仓储订单处理更快、服务机器人等待时间更短,改善终端用户体验。

与现有产品/工作流的接口

PolicyTrim 定位为后训练增强模块,易于集成进现有 VLA 流水线:

  • 兼容主流 VLA 模型:已在 OpenVLA、RT-2 等架构上验证,可即插即用地适配金融、教育等领域的定制化 VLA。
  • 结合计算效率优化:PolicyTrim 着眼策略效率,与模型剪枝、量化、投机推理等计算优化方法正交叠加,进一步推升整体性能。
  • 训练成本可控:基于强化学习的微调仅需少量额外数据(论文提及仅需几十条任务演示),可在模型更新周期中快速实施。

具体落地用例

  • 跨国电商仓储:在商品种类频繁变动(如快时尚电商)的半结构化仓库,移动操作机器人需快速学会新任务。PolicyTrim 的后训练方式允许在极小样本下压缩动作冗余,使新任务部署速度从数天缩短至数小时,且保持 95% 以上成功率,直接降低换季成本。
  • 可再生能源充电运维:光伏电站清扫机器人、电动车自动充电机械臂要求高可靠的低步数操作。PolicyTrim 通过奖励惩罚机制消除不可复现的“捷径”,确保在户外多变光照/视觉扰动下依然稳定执行,减少人工介入与设备损耗。

局限

  • **强化学习后训练的计算成本与 sim-to-real 迁移**:PolicyTrim 依赖大量环境交互来收敛动态探索策略与冗余感知奖励,训练过程需要额外的模拟器 rollouts,虽然在论文的基准任务中有效,但对更复杂的长期任务或需要精细力控的接触式操作,可能面临随机性增加导致的训练不稳定。此外,在真实世界部署时,环境动态与仿真差异可能削弱动作块延长的可靠性,需要仔细的域随机化或在线适应,否则可能导致物理步骤缩减策略在实际硬件上引入不安全行为。
  • **动作块延长的上限受模型容量制约**:方法通过动态探索逐步将可靠执行长度推向经验极限,但本质仍受限于 VLA 基座模型的预测能力。当任务需要极长时序推理或复杂约束时,即使引入 RL 优化,动作块尾部的预测退化可能难以根除,表现为成功率在长 Horizon 测试中的滑坡。论文的消融实验虽验证了有效长度提升,但未讨论当任务超出模型上下文窗口或需要分层规划时的可扩展性。
  • **与计算优化方法的协同设计未充分探索**:PolicyTrim 聚焦于内在策略效率,声称与计算中心的加速方法(如模型蒸馏、量化)正交,但两者在实际系统中可能相互干扰。例如,动作块延长后,单次推理输入 token 可能增加,反而拉低轻量化模型的吞吐;冗余物理步骤的减少也可能影响观察频率,使得某些依赖于高频反馈的低级控制器暴露不足。论文未提供两种优化方向的联合分析,可能影响端到端部署时的总体收益。
论文Xianghui Wang2026-06-21原文

相关内容