微软亚洲研究院等提出UniSteer:以人类纠正引导VLA噪声空间强化学习
UniSteer通过动作到噪声的近似反演,将人类纠正转化为可用的强化学习信号,大幅降低VLA真机适配成本。
视觉-语言-动作模型(VLA)能完成抓取等任务,但高精度操作仍需真机强化学习。UniSteer把人类纠正动作反演为噪声监督,只训练一个小型noise actor,冻结原模型,让机械臂在极少量人类演示下学会拼豆,在线学习数据仅两条完整轨迹。
正文摘录
.jpg)  视觉 - 语言 - 动作模型(Vision-Language-Action Model,VLA)正在成为机器人操作的重要基础模型。经过少量示范微调后,VLA 已经能够完成抓取、放置、堆叠等多种任务。然而,一旦任务涉及精密接触、狭小容差或分布外位置,模型的成功率仍会明显下降。 这也是为什么真机强化学习如此重要:预训练和模仿学习赋予机器人一个不错的起点,而强化学习让它能够在真实环境中继续试错,适应具体物体、视角和接触动力学。但真机试错的成本远高于仿真。每一次失败都会消耗设备时间、实验人员精力,甚至破坏任务现场。 因此,真机强化学习面对的核心问题不是能否学习,而是: 如何用尽可能少的真实交互,让策略尽快学会成功? 一个自然的答案是让人类参与。模型探索错误方向时,人类可以立即接管并完成纠正。然而,对于采用流匹配(flow matching)的 VLA,新的矛盾随之出现:人类给出的是机器人动作,轻量强化学习优化的却是初始噪声。人类知道机械臂应该怎样移动,却无法直接告诉模型应该选择哪一个噪声。 人类动作与噪声空间之间,缺少一个可靠的接口。