行业新闻

微软亚洲研究院等提出UniSteer:以人类纠正引导VLA噪声空间强化学习

UniSteer通过动作到噪声的近似反演,将人类纠正转化为可用的强化学习信号,大幅降低VLA真机适配成本。

视觉-语言-动作模型(VLA)能完成抓取等任务,但高精度操作仍需真机强化学习。UniSteer把人类纠正动作反演为噪声监督,只训练一个小型noise actor,冻结原模型,让机械臂在极少量人类演示下学会拼豆,在线学习数据仅两条完整轨迹。

正文摘录

![](https://image.jiqizhixin.com/uploads/article/coverimage/57d5cf4a-f803-4bc2-9c15-6f98c41f18c3/017(2).jpg) ![图片](https://mmbiz.qpic.cn/szmmbizpng/5L8bhP5dIqElqZ0GcgINP4V78xIEARSSDI7pRpUQpZAhGK6rr8zoMJM3icYLohdHNhq93gll1YkHwsYaOO3tolCuL5QN5gAtJc46PnNgECQI/640?wxfmt=png&from=appmsgimgIndex=0) 视觉 - 语言 - 动作模型(Vision-Language-Action Model,VLA)正在成为机器人操作的重要基础模型。经过少量示范微调后,VLA 已经能够完成抓取、放置、堆叠等多种任务。然而,一旦任务涉及精密接触、狭小容差或分布外位置,模型的成功率仍会明显下降。 这也是为什么真机强化学习如此重要:预训练和模仿学习赋予机器人一个不错的起点,而强化学习让它能够在真实环境中继续试错,适应具体物体、视角和接触动力学。但真机试错的成本远高于仿真。每一次失败都会消耗设备时间、实验人员精力,甚至破坏任务现场。 因此,真机强化学习面对的核心问题不是能否学习,而是: 如何用尽可能少的真实交互,让策略尽快学会成功? 一个自然的答案是让人类参与。模型探索错误方向时,人类可以立即接管并完成纠正。然而,对于采用流匹配(flow matching)的 VLA,新的矛盾随之出现:人类给出的是机器人动作,轻量强化学习优化的却是初始噪声。人类知道机械臂应该怎样移动,却无法直接告诉模型应该选择哪一个噪声。 人类动作与噪声空间之间,缺少一个可靠的接口。

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-09-02原文

相关内容