星尘智能发布 SmoothRL,解决机器人异步执行下的在线强化学习问题
SmoothRL 让在线强化学习适应机器人异步执行,只从真实动作中学习,提升动态操作成功率。
星尘智能推出 SmoothRL,一个能适配异步推理的在线强化学习框架。机器人执行动作时模型在后台计算,导致计划与执行不一致。SmoothRL 只对真实执行的动作做强化学习,并与部署时相同的节奏训练,让投掷等动态任务成功率大幅提升。
正文摘录
星尘智能(Astribot) 基座模型团队发布能异步执行的在线强化学习框架 SmoothRL 现在的 VLA、World-Action Model 往往一次生成未来一段时间的动作序列,也就是 action chunk。模型越来越大,推理时间也越来越长,但机器人不能每隔几百毫秒就停下来等模型推理下一段时间的动作。尤其在投掷这类高动态任务里,一次停顿就可能让已经积累起来的速度掉下去,导致整个任务失败。 所以真实部署里更常见的方式是 异步推理 :机器人继续执行手头的动作,模型同时在后台计算下一段。简单说, 手上做 A,模型已经在算 B。 但这给在线强化学习带来了一个新的问题:模型一次生成了一段动作序列(action chunk),进入物理世界的真正会用的,却往往只有其中一部分。模型“计划过”的动作,和机器人“真正做过”的动作,不再完全相同。 近日,星尘智能(Astribot) 基座模型团队发布能异步执行的在线强化学习框架 SmoothRL(Online Reinforcement Learning During Asynchronous Execution) 。解决的是 大模型异步推理成为真实部署常态后,与之适配的online RL 到底该从哪些动作里学。 SmoothRL 首次将这类异步 online RL 放到真实高动态投掷任务中验证,进一步证明在线学习不仅能用于高精度修正,也能适配连续加速、精确释放、不能停顿的动态操作。 图注: SmoothRL 整体框架:机器人在异步执行中持续产生真实数据,基础策略提供通用能力,在线 RL 会根据真实执行结果更新动作策略。 传统在线 RL 往往默认一种更规整的节奏:模型先算出动作,机器人执行,再根据结果更新策略。模型生成什么,机器人就执行什么。 异步执行打破了这个对应关系。