北大与微软亚研提出 BCP 让模型自主决定重规划时机
BCP 把固定执行步数变成逐动作的“继续/重规划”决策,让机器人每次都能在关键时刻重新观察,简单轻量却显著提升成功率。
视觉-语言-动作模型(VLA,一种让机器人根据视觉和语言指令执行动作的模型)通常按固定步数执行动作后再重新规划,但这样可能错过关键操作阶段。北大和微软亚洲研究院提出 BCP,让模型在每个动作后决定继续还是重规划,并用轻量模块和强化学习优化,使机器人成功率显著提升。
正文摘录
.jpg)  在 action chunking 已成为 VLA 标配的今天,「一次执行多少步」几乎被所有工作当作一个固定的超参数。北京大学与微软亚洲研究院的一项新工作指出:这个默认设定本身就是一个重要的失败原因 —— 它让重规划变成了与任务进度无关的周期性调度,当没有任何一次重规划恰好落在关键操作阶段之前时,机器人只能带着一个已经过时的 chunk 进入关键操作环节。 研究团队提出了 Bernoulli-Continuation Policy(BCP) : 冻结基座 VLA,仅训练一个 16.4M 参数的轻量级 head,把「执行多久」分解为一系列「继续执行还是重新规划」的伯努利决策,并通过 GRPO 从轨迹级结果中进行优化。在 RoboTwin 2.0 全部 50 个任务上,LingBot-VLA 的平均成功率从 89.88% 提升至 93.94%, 在 VLA 方法中取得 SOTA ;真机挂马克杯任务的成功率则从从 44% 提升至 84%。