行业新闻

HIL-ResRL:1小时真机RL微调成功率突破95%

HIL-ResRL通过人类在线反馈强化学习,让VLA模型在真机任务中1小时微调成功率超过95%,大幅降低训练成本。

HIL-ResRL(基于人类交互的强化学习微调,一种在线结合人类反馈来优化视觉-语言-动作模型的方法)能在真实机器人上仅用1小时微调就将任务成功率提升至95%以上,且即插即用,无需修改原有模型结构。这解决了传统RL微调耗时长、成功率低的问题,让机器人快速适应新场景。

正文摘录

1小时真机 RL 微调成功率破 95%!HIL-ResRL:即插即用的 VLA “外挂”神器 在具身智能的浪潮中,视觉 – 语言 – 动作(VLA)模型展现出了惊人的泛化能力。然而,当你真正尝试把这些模型部署到真实物理世界或工业产线上时,往往会被现实狠狠“打脸”。 为什么?因为目前的 VLA 模型主要依赖于模仿学习(Imitation Learning,尤其是行为克隆 BC)。这种范式存在一个致命的硬伤:误差累积和分布偏移。在实验室里,机械臂抓取可能十拿九稳;但如果在产线上,目标物体的位置稍微偏离了演示数据的分布,机器人就会“懵圈”甚至做出危险动作。 虽然大家都在尝试用真实世界强化学习(Real-world RL,如近期的 π0.6★)来让机器人“自我纠错”,但这些方法往往计算代价极其高昂,且与特定的模型架构深度绑定。对于追求快速部署的柔性制造业来说,这显然不够灵活。 今天我们要介绍的这篇来自华为云 CloudRobo 团队的论文,提出了一种优雅的解决方案——HIL-ResRL(基于人机协同残差强化学习的模型无关微调适配器)。它把基础 VLA 模型当成黑盒,不仅不挑模型,而且仅需 1 小时真机在线训练,就能让任务成功率突破 95%! 面对复杂的工业级 VLA 模型,HIL-ResRL 并没有选择从头再训练或者整体微调,而是采用了一种极其轻量化的残差策略(Residual Policy),结合人机协同的哲学,整体框图如下: 这种即插即用(Plug-and-play)的设计意味着它可以无缝集成到任何现成的 VLA 模型中,而无需获取其内部的权重或生成范式(无论是 Diffusion 还是 Flow Matching)。 如果仅仅是加上残差网络让机器人自己去“试错”,不仅样本效率极低,而且随机探索很容易损坏昂贵的机械臂硬件。

阅读原文(qbitai.com)→

行业新闻量子位的朋友们2026-06-24原文

相关内容