PolicyTrim 后训练减少 VLA 机器人冗余动作 最高加速 5.83 倍
PolicyTrim 是一种针对 VLA 机器人执行效率的后训练方法,通过强化学习减少冗余动作,最高加速 5.83 倍且不牺牲成功率。
现有的 VLA 模型(视觉-语言-动作统一策略)执行任务时存在冗余动作和不可靠预测。PolicyTrim 通过两阶段强化学习,先扩展可靠动作块,再压缩冗余,无需重新训练即可减少物理步数。在多个基准和真实机器人上,最高加速 5.83 倍,成功率稳定。
正文摘录
 新智元报道  【新智元导读】 VLA 模型已经会做任务,但真实机器人还是慢!PolicyTrim 是一种优化 VLA 机器人执行效率的方法,无需重新训练。它通过扩展可靠动作序列并减少冗余步骤,帮助机器人更直接完成任务,提升整体速度。 Vision-Language-Action(VLA)模型把视觉观测、语言指令和机器人动作统一到一个策略模型中,使机器人能够根据自然语言完成复杂操作任务。 从 OpenVLA、OpenVLA-OFT 到 π0.5、GR00T,这类模型正在成为具身智能的重要技术路线。 但当 VLA 模型真正部署到机器人上时,一个关键瓶颈会立刻显现:机器人完成任务的总时间,不只取决于每次推理有多快,也取决于策略到底需要执行多少次推理、多少个真实物理动作。  在同一任务的多次 rollout 中,VLA 模型的执行步数存在显著波动,说明更短、更直接的成功路径是可达的,但当前策略往往只能偶然找到。 动作 chunk 尾部不可靠:模型一次预测多个动作,但越靠后的动作越容易累积误差,系统不得不频繁重新规划,强行拉长执行长度会降低成功率并增加物理步数。 物理动作冗余严重: 即便任务最终成功,轨迹里也可能包含大量纠错、回退和重复动作。