行业新闻

HIL-ResRL 真机微调1小时成功率超95%

HIL-ResRL 用人类在环和残差策略,让机器人1小时学会纠偏,成功率从50%提升到95%以上。

华为云提出 HIL-ResRL,一种即插即用的残差强化学习方法,让机器人基础模型在真实世界1小时训练后任务成功率超95%。人类操作员只在危险时介入,无需大量演示,解决了分布偏移问题。

正文摘录

![](https://image.jiqizhixin.com/uploads/article/coverimage/5ce5e066-8ff2-4dda-8c06-7b760bd20cdc/%E5%9B%BE%E7%89%872(2).png) 在具身智能的浪潮中,视觉 - 语言 - 动作(VLA)模型展现出了惊人的泛化能力。然而,当你真正尝试把这些模型部署到真实物理世界或工业产线上时,往往会被现实狠狠 “打脸”。 为什么?因为目前的 VLA 模型主要依赖于 模仿学习(Imitation Learning, 尤其是行为克隆 BC)。这种范式存在一个致命的硬伤:误差累积和分布偏移。 在实验室里,机械臂抓取可能十拿九稳;但如果在产线上,目标物体的位置稍微偏离了演示数据的分布,机器人就会 “懵圈” 甚至做出危险动作。 虽然大家都在尝试用真实世界强化学习(Real-world RL,如近期的 π0.6∗)来让机器人 “自我纠错”,但这些方法往往计算代价极其高昂,且与特定的模型架构深度绑定。对于追求快速部署的柔性制造业来说,这显然不够灵活。 今天我们要介绍的这篇来自华为云 CloudRobo 团队的论文,提出了一种优雅的解决方案 —— HIL-ResRL(基于人机协同残差强化学习的模型无关微调适配器)。它把基础 VLA 模型当成黑盒,不仅不挑模型,而且仅需 1 小时真机在线训练,就能让任务成功率突破 95%!

阅读原文(jiqizhixin.com)→

行业新闻新闻助手2026-06-24原文

相关内容