星尘智能发布 SmoothRL,在线强化学习适配异步执行
星尘智能提出 SmoothRL,解决异步推理下在线强化学习该学哪些动作的问题,真实机器人任务成功率显著提升。
机器人异步执行时,模型生成的动作与真实执行的不一致,传统强化学习会“记错账”。星尘智能推出 SmoothRL,将动作分区分隔,只从真正执行的部分学习,并用在真实高速投掷等任务中,成功率大幅提升。
正文摘录
 真实机器人没有“暂停键”。 现在的 VLA、World-Action Model 往往一次生成未来一段时间的动作序列,也就是 action chunk。模型越来越大,推理时间也越来越长,但机器人不能每隔几百毫秒就停下来等模型推理下一段时间的动作。尤其在投掷这类高动态任务里,一次停顿就可能让已经积累起来的速度掉下去,导致整个任务失败。 所以真实部署里更常见的方式是 异步推理 :机器人继续执行手头的动作,模型同时在后台计算下一段。简单说, 手上做 A,模型已经在算 B。 但这给在线强化学习带来了一个新的问题:模型一次生成了一段动作序列(action chunk),进入物理世界的真正会用的,却往往只有其中一部分。模型“计划过”的动作,和机器人“真正做过”的动作,不再完全相同。 近日,星尘智能(Astribot) 基座模型团队发布能异步执行的在线强化学习框架 SmoothRL(Online Reinforcement Learning During Asynchronous Execution) 。解决的是 大模型异步推理成为真实部署常态后,与之适配的online RL 到底该从哪些动作里学。