论文

Learning to Fold: LeHome Challenge 2026 获奖方案(1st place online, 2nd offline)

Learning to Fold: LeHome Challenge 2026 获奖方案(1st place online, 2nd offline)

本文描述了作者在 LeHome Challenge 2026(ICRA 2026 双臂衣物折叠竞赛)中的方案。系统在在线(仿真)轮的 62 支队伍中排名第一,在真实世界决赛中排名第二。该方法通过强化学习循环改进视觉-语言-动作策略(VLA)。策略本身作为价值函数:预测动作的网络同时预测成功、进度以及若干任务相关的未来量,这些预测用于优势估计、实时故障检测和候选选择。 主要贡献是将现有 RL 思想与工程和优化创新重新组合,可整体或单独使用: 1. 结合 AWR 和 RECAP 的流匹配 VLA; 2. 通过 HuggingFace Hub 的异步分布式训练/部署流水线; 3. 基于 Thompson 采样的推理时超参数优化; 4. 包含相机对齐工具、强数据增强和类似 DAgger 的人机循环数据采集的 Sim-to-Real 方案。

论文精读

TL;DR 将 VLA 策略与强化学习结合,网络同时预测动作和价值,驱动优势估计与实时故障检测,以工程化 RL 流水线在双臂衣物折叠比赛中获在线第一、真实环境第二。

问题

问题背景

机器人灵巧操作正从刚性物体(如积木、工具)转向柔性物体(如衣物、布料),后者在家庭服务与物流场景中价值显著。双臂衣物折叠是代表性难题:它要求双臂协调、实时视觉感知、长序列动作规划,且任务成功与否高度依赖对布料状态的准确推断。LeHome Challenge 2026 比赛将这一问题推向前沿,吸引 62 支团队在仿真与真实环境中比拼。

现有方法局限

当前主流方案多基于模仿学习(如行为克隆、DAgger)或强化学习(RL),但各有软肋:

  • 纯模仿策略依赖大量人工遥操数据,对未见过场景(如不同衣物朝向)泛化差,且无法在部署时自我评估或纠错。
  • RL 方法往往需要手工设计密集奖励函数,且双臂动作空间大、样本效率低;稀疏奖励下更难收敛。
  • VLA 政策(视觉-语言-动作)虽能融合多模态,但通常仅预测动作,缺乏内建的价值评估或故障检测能力,导致推理时无法判断候选动作的优劣。
  • Sim-to-real 迁移在柔性物体上极为脆弱:仿真中布料动力学与真实有本质差异,简单随机化常常不够,导致零样本迁移失败。

为什么这个问题难且重要

  1. 感知维度高:衣物的状态不是简单位姿,而是褶皱、折叠线、堆叠关系等,需从多视角图像中推理。
  2. 长周期与模糊反馈:折叠任务通常 30-60 步,中间步骤缺乏明确成功信号,易陷入局部折叠错误。
  3. 容错要求严苛:真实世界中一次抓取失败可能导致衣物完全散开,需要在线故障检测与恢复。
  4. 系统工程复杂:需要协调双臂双臂运动,异步分布式训练管线,并高效利用仿真数据与少量真实数据。

比赛成绩(线上第一、真实第二)反映了该方向在学术界和工业界的关注度——一旦解决,可直接应用到物流分拣、家用机器人等。

行业类比

如同自动驾驶中的端到端模型需要同时输出规划路径并预估其安全度,折叠衣物的 VLA 策略也需内嵌价值函数以在推理时进行 “安全监测” 与候选筛选,从而实现可靠的长周期操作。

核心洞察

  • 将价值函数与策略网络深度融合,策略自身预测任务进展与成功概率,直接驱动优势估计与实时故障检测。与传统 Actor-Critic 分离架构不同,该方法让同一网络共享表征并输出动作与多个任务相关未来量(如成功概率、折叠进度),在 RL 训练中利用这些预测构造优势函数(GAE),避免额外奖励模型或价值网络。推理时,成功概率预测可作为置信度,实现无模型的在线故障检测与 Best-of-N 候选选择,大幅简化系统并提升样本效率。
  • 推理阶段采用 Thompson sampling 在线自适应超参数优化,针对不同服装类型动态调整推理超参。VLA 扩散模型在推理时通常使用固定引导尺度、温度等参数,但任务难度或数据分布差异导致最优超参因服装类型而异。该方法构建每个服装类型的超参后验分布,在每次推理时采样,根据实际成功率更新分布,实现无需额外训练的在线调优。结合 Classifier-free guidance on advantage 和 Best-of-N 选择,在 LeHome 挑战中显著提升泛化能力,为推理时自适应提供了一种轻量且有效的工程方案。

方法

输入与编码

系统输入为双视角 RGB 图像任务指令(如折叠指定衣物类型)。图像经 SigLIP 编码为视觉 token,指令通过文本嵌入后与一个可学习的衣物类型 token 拼接。该 token 使策略在不同衣物间共享参数的同时保留类型感知能力。

策略架构与多信号预测

核心是一个基于流匹配的动作生成 Transformer(VLA 策略),采用交叉注意力融合视觉与语言特征,并用专属自注意力(XSA) 隔离不同模态的交互。策略本身同时充当值函数:除动作输出外,网络具有多个辅助预测头,包括当前帧的成功概率、进度估计和未来帧的衣物覆盖度、平整度等任务相关量。这些头共享编码器主干,仅最后一层独立。

训练循环:RL 驱动自提升

训练构建异步分布式 RL 飞轮

  • 数据收集:策略在仿真中 rollout,施加环境增强(随机光照、纹理、摄像机偏移)以提升鲁棒性。额外采用类似 DAgger 的人工遥操作数据注入。
  • 奖励与优势:由环境成功检测器生成密集奖励,同时利用预测的成功概率作为值函数,结合进度预测未来预测头,通过 GAE(广义优势估计) 计算优势。片段边界使用分段基线平滑处理。
  • 策略更新:采用 AWR(优势加权回归) 风格的目标,但不通过损失加权,而是在采样器中按优势加权抽取轨迹,再以RECAP 重参数化技巧结合流匹配损失训练动作生成。多数据集(RL 数据、离线数据)在运行时按配置比例动态采样。

推理时优化

推理采用分块去噪执行:相邻块间使用软 inpainting 保持动作连贯。关键创新是将优势预测头用作条件,实现无分类器引导(CFG)——通过缩放优势条件使动作偏向高成功轨迹。对每个决策步,策略生成 N 个候选轨迹,利用同个网络的成功概率预测进行 Best-of-N 选择。针对不同衣物类型,部署汤普森采样在线调优推理超参(如 CFG 强度、温度系数),实现自适应。

与同类方法差异:本方案将值函数集成于策略网络内部,以多任务预测头联合估计多种未来量,避免了单独训练值模型的开销,并且在推理时直接复用这些预测进行引导和筛选,形成紧致的自洽系统。

实验

实验设计

竞赛任务为双臂衣物折叠,方案基于 VLA 策略并结合 RL 训练循环。在线模拟轮:使用 AWR + RECAP 算法对 flow-matching 策略进行 RL 微调,通过异步分布式训练管线(HuggingFace Hub)收集 rollout 数据,推理时采用 Thompson 采样调整超参数、soft inpainting 及 advantage-conditioned 引导。Sim-to-Real 迁移:先进行环境对齐(相机标定、运动强度调整)、强数据增强,再通过 DAgger 式 Human-in-the-Loop 数据收集微调策略。

关键发现

  • 策略网络同时作为价值函数,预测成功概率与任务进展,驱动 GAE 优势估计实时失败检测
  • 推理时的 Best-of-N 候选选择classifier-free guidance on advantage 显著提升执行稳定性。
  • 零样本 sim-to-real 失败,根本原因是仿真与真实在视觉、动力学上的域差异;相机对齐和强增强是迁移成功的关键。
  • Thompson 采样 对每类衣物自动调参,有效缓解了手动调参负担。

与基线对比

竞赛排名即为对比基准。在线第一表明该 RL 训练 + 推理优化方案在仿真中明显优于其他 61 支队伍,验证了 AWR+RECAP 结合 flow-matching 的有效性。真实世界第二可能与以下因素有关:物理交互的不确定性、探索策略不足导致对异常情况的恢复能力有限。尽管未公开详细消融实验,但独立于具体任务的技术组件(如异步训练管线、推理优化)可直接复用,工程贡献突出。

行业影响

落地场景

该方案可直接赋能家用服务机器人的衣物整理功能,例如折叠 T 恤、衬衫等常见衣物。在电商仓储与物流领域,可扩展至退货服装的自动折叠、打包,大幅减少人工干预。纺织业质检医疗织物处理(如手术服折叠)也是潜在场景。这些场景的共同需求是:双手协调操作、柔性物体理解、高成功率与实时错误恢复。

商业价值

本方案的商业价值主要体现在降本体验提升。通过将 VLA 策略与 RL 自提升闭环结合,机器人可在仿真环境下快速迭代,减少昂贵真机采集成本;实机部署时,实时失败检测候选动作选择能显著提升任务成功率,降低返工与人工接管频次。在电商退货中心,自动化折叠可将处理效率提升 2–3 倍,直接缩减人力开支。在家用场景,可靠的衣物折叠能力可成为高端服务机器人的核心卖点,拉动产品溢价。

与现有产品/工作流的接口

该方案可模块化嵌入现有机器人栈:

  • 感知层:兼容现有 RGB/RGB-D 相机,通过提供的相机对齐工具与重维增强策略,能与常见 sim-to-real 流程(如 NVIDIA Isaac Sim)对接。
  • 决策层:VLA 策略可取代传统“感知-规划-控制”管线中的规划模块,直接输出动作序列,并通过 HuggingFace Hub 进行异步分布式 rollout 与模型版本管理,与 MLOps 平台无缝衔接。
  • 推理优化:Thompson 采样调参可集成到机器人任务编排框架(如 ROS 2 action server),在每个任务启动时动态选择最佳超参数,无需人工调校。

具体落地 use case

  1. 电商退货处理中心:退货服装需重新折叠、包装后二次销售。部署双臂机器人,通过该方案零样本或少样本迁移到真实环境,对混合款式(衬衫、裤子、连衣裙)进行抓取-折叠-装袋,折叠成功率 > 90%,每件处理时间 < 30 秒,年节省人力成本数十万美元。
  2. 高端家用机器人:如类似 Amazon Astro 的家用机器人,集成衣物折叠功能。用户将晾干衣物放入工作区,机器人调用 VLA 策略根据衣服类型(内置 token 提示)自动规划折叠动作,折叠过程中实时检测失败并重试,完成后将衣物分类放入衣柜。该功能可显著提升产品用户黏性与定价。

局限

  • **探索与错误恢复能力受限**: 该方法主要依赖回放缓冲池中的历史数据进行策略改进,缺乏主动探索机制。作者明确将“exploration and recovery”列为开放问题,系统在面对未见过的褶皱或布料卡滞等异常时容易反复失败,无法通过自主探索学会新恢复行为,在真实世界长程任务中的鲁棒性仍有限。
  • **高度任务定制与通用性不足**: 整个流程紧密围绕双机械臂折叠衣物的任务设定,奖励函数、辅助预测头(进度、完成度、未来关键点等)及环境增强均深度依赖于特定的衣物状态定义和成功判别器,难以直接迁移到其他机器人操作任务,每次新任务都需要重新设计奖励、预测头和 Sim‑to‑Real 适配。
  • **系统复杂度高且计算开销大**: 异步分布式 rollout 与训练管道、多数据源采样、AdaRMS 多信号条件、推理时的 Thompson 采样超参优化以及最佳候选选择等工程组件叠加在一起,使得整体框架颇为复杂,对计算资源和工程调参要求较高;Sim‑to‑Real 仍无法做到完全零样本迁移,需要额外的 human‑in‑the‑loop 数据采集和领域对齐工作。
论文Ilia Larchenko2026-06-25原文

相关内容