行业新闻

PolicyTrim 后训练减少 VLA 机器人冗余动作 最高加速 5.83 倍

PolicyTrim 后训练减少 VLA 机器人冗余动作 最高加速 5.83 倍

PolicyTrim 是一种针对 VLA 机器人执行效率的后训练方法,通过强化学习减少冗余动作,最高加速 5.83 倍且不牺牲成功率。

现有的 VLA 模型(视觉-语言-动作统一策略)执行任务时存在冗余动作和不可靠预测。PolicyTrim 通过两阶段强化学习,先扩展可靠动作块,再压缩冗余,无需重新训练即可减少物理步数。在多个基准和真实机器人上,最高加速 5.83 倍,成功率稳定。

正文摘录

![](https://aiera.com.cn/wp-content/uploads/2026/07/aieraimg07dd327571.png) 新智元报道 ![](https://aiera.com.cn/wp-content/uploads/2026/07/aieraimg3b253ef414-182.png) 【新智元导读】 VLA 模型已经会做任务,但真实机器人还是慢!PolicyTrim 是一种优化 VLA 机器人执行效率的方法,无需重新训练。它通过扩展可靠动作序列并减少冗余步骤,帮助机器人更直接完成任务,提升整体速度。 Vision-Language-Action(VLA)模型把视觉观测、语言指令和机器人动作统一到一个策略模型中,使机器人能够根据自然语言完成复杂操作任务。 从 OpenVLA、OpenVLA-OFT 到 π0.5、GR00T,这类模型正在成为具身智能的重要技术路线。 但当 VLA 模型真正部署到机器人上时,一个关键瓶颈会立刻显现:机器人完成任务的总时间,不只取决于每次推理有多快,也取决于策略到底需要执行多少次推理、多少个真实物理动作。 ![](https://aiera.com.cn/wp-content/uploads/2026/07/aieraimg249fa6d398.png) 在同一任务的多次 rollout 中,VLA 模型的执行步数存在显著波动,说明更短、更直接的成功路径是可达的,但当前策略往往只能偶然找到。 动作 chunk 尾部不可靠:模型一次预测多个动作,但越靠后的动作越容易累积误差,系统不得不频繁重新规划,强行拉长执行长度会降低成功率并增加物理步数。 物理动作冗余严重: 即便任务最终成功,轨迹里也可能包含大量纠错、回退和重复动作。

阅读原文(aiera.com.cn)→

行业新闻新智元2026-07-22原文

相关内容