论文

Hy-Embodied-0.5-VLA: 从 Vision-Language-Action 模型到真实世界机器人学习栈

Hy-Embodied-0.5-VLA: 从 Vision-Language-Action 模型到真实世界机器人学习栈

本文提出 Hy-Embodied-0.5-VLA(简称 HyVLA-0.5),一个覆盖完整机器人学习栈的端到端系统。该栈包含五个关键阶段:数据收集、模型设计、继续预训练与有监督微调、RL 后训练以及真实世界部署。 每个组件在系统中扮演独特角色:数据收集提供训练样本;模型设计定义网络架构;继续预训练与微调提升模型能力;RL 后训练通过强化学习优化策略;最终在真实环境中验证性能。这一统一框架简化了从研究到部署的流程。

论文精读

TL;DR HyVLA-0.5 构建了从高精度人手遥操作数据(>10k 小时)到流匹配 VLA 模型、RL 后训练及真实部署的完整学习栈,证明全栈协同是通用机器人操作的关键。

问题

问题背景

通用机器人操作领域正从单任务策略学习迈向通用视觉-语言-动作模型(Vision-Language-Action, VLA),期望单一模型能处理多种场景与物体。业界共识是,真正的通用机器人不可能仅靠一个独立模型,而必须依赖从数据采集到实际部署的完整学习堆栈

现有方法局限

当前多数 VLA 研究仍以模型为中心,存在三个关键断层:

  • 数据规模与精度不足:常用遥操作或人类视频,缺乏亚毫米级精度、大范围覆盖的操作演示,且难以直接迁移到机器人训练轨迹。
  • 模型架构未解耦形态差异:动作预测常与特定机器人动力学绑定,导致跨本体泛化困难;记忆机制简陋,无法高效利用连续观测历史。
  • 训练与部署割裂:预训练、微调、强化学习后训练分开设计,缺乏贯穿全流程的配方;推理时延迟和动作一致性未在模型设计中提前考虑,导致实际部署成功率骤降。

为什么这个问题难且重要

  • 数据获取挑战:真实世界操作数据采集昂贵、危险且依赖专家,而仿真与现实有 domain gap,亚毫米精度的灵巧操作数据尤为稀缺。
  • 全栈耦合复杂性:数据格式、模型架构、训练目标、部署约束需联合优化。例如,动作表示必须兼容多模态本体运动学,而推理速度又直接受模型大小和注意力设计制约。
  • 业界关注度:从 Google DeepMind 的 RT-2,到 Figure AI 的全栈系统,再到 Toyota Research Institute 的 Large Behavior Model,各大实验室均意识到端到端学习堆栈是通向具身基础模型的必经之路,而非仅比拼模型 capacity。

行业类比

这类似自动驾驶系统从感知到规划控制的端到端开发:早期各家仅优化检测或预测单一模块,最终发现必须在数据引擎、多模态融合、仿真测试、实时部署上形成闭环,才能实现可靠量产。

核心洞察

  • **全栈机器人学习系统**:HyVLA-0.5 将数据采集、模型设计、多阶段训练与强化学习后训练、真实部署整合为统一管线,而非只关注单一模型。这区别于多数 VLA 工作仅优化网络架构的做法,揭示了实际机器人系统必须将数据质量、训练步聚与部署约束作为整体考虑,各组件协同设计才能交付可靠的真实世界性能。
  • **高精度演示数据闭环**:通过自制指尖 UMI 设备捕获超 10,000 小时的亚毫米精度自我中心演示,且这些数据可直接用作后训练轨迹。这解决了操作任务中精细动作数据不足的痛点,与传统遥操作采集相比,既提升了示教精度,又将数据收集、预训练和 RL fine-tuning 连接成闭环,使真机微调能直接从人类技能中受益。
  • **动作表示与具身解耦**:引入流匹配动作专家和 delta-chunk 动作表示,将策略学习与特定机器人运动学分离。相比固定动作维度的端到端方案,该方法让模型更容易跨不同形态迁移,仅需改变下游映射,大幅降低从仿真到多种硬件部署的工程成本,是具身通用性的关键一步。

方法

HyVLA-0.5 构建了一个从数据采集到真实世界部署的完整机器人学习栈。

输入:系统接收多模态传感器数据,包括由定制的指尖 UMI (Universal Manipulation Interface) 设备采集的高精度人类演示(亚毫米精度动作捕捉)、第三视角/末端观测图像、语言指令以及机器人本体状态。

关键模块

  1. 数据收集:使用指尖 UMI 与动作捕捉笼采集超过 10,000 小时的以自我为中心的操作数据,该数据可直接用作后训练的初始轨迹。
  2. 模型架构
    • 骨干网络 Hy-Embodied-0.5:模态自适应计算主干,统一处理视觉和语言输入。
    • 动作专家:基于双塔流匹配 (Flow Matching) 生成动作,采用 delta-chunk 动作表示 将策略学习与具体机器人运动学解耦,增强跨具身泛化。
    • 记忆编码器:通过时空注意力将历史观测压缩为紧凑表示,支持长时任务。
  3. 预训练与 SFT:在 UMI 语料库上继续预训练后,引入两个真实机器人 监督微调 (SFT) 分支,提升真实环境中的基础策略。
  4. 强化学习后训练:基于特定设计原则,在仿真和真实环境中进行 RL 微调,直接优化操控成功率。
  5. 部署栈
    • 具身无关平台映射:将末端位姿指令转换为不同本体的执行信号。
    • 异步执行:推理与执行流水线解耦,实现低延迟实时控制。
    • 延迟感知 Bézier 块拼接:对输出动作块进行平滑插值,消除抖动。

输出:最终输出连续的末端执行器位姿轨迹,直接驱动机器人完成复杂操作任务。

差异点:与仅关注模型设计的 VLA 工作不同,HyVLA-0.5 将数据、训练、RL 后训练与工程部署同等视为系统核心,特别针对真实世界实时控制和跨平台迁移做了联合优化。

实验

实验设计

HyVLA-0.5 的实验覆盖模拟与真实场景,旨在验证全栈机器人学习系统的有效性。

  • 数据层面:构建 Hy-UMI-10K——通过自定义指尖 UMI 设备与动捕笼采集的逾 10,000 小时亚毫米精度、以自我为中心的人类演示,既用于继续预训练,也直接用作强化学习后训练(RL post-training)的轨迹。
  • 模型评估:在 RoboTwin 2.0 模拟基准上进行标准化评测,并设计多组真实世界操作任务(如抓取、放置等),考察策略在非结构化环境中的泛化能力。
  • 对比基线:报告虽未给出具体数值,但强调从 VLA 模型到全栈系统的差异:强调数据精度、动作表示、以及 RL 后训练对最终策略质量的关键作用。

关键发现

  1. 高精度数据是基石Hy-UMI-10K 的亚毫米级动作捕捉极大减少了视觉-动作对齐噪声,使预训练阶段即可学到精细的操作先验,迁移至真机时无需复杂的域适应。
  2. 解耦的动作专家设计:引入流匹配动作专家delta-chunk 动作表示,将策略学习与具体形态运动学解耦,使同一模型可适配多种机器人本体,提升了跨实施例泛化能力。
  3. RL 后训练弥合 sim-to-real 差距:在现实机器人上执行额外 RL 微调,能够修正监督微调(SFT)策略在真实环境中的累积误差,显著提升任务成功率和鲁棒性。
  4. 端到端部署优化:异步执行、延迟感知 Bézier 块拼接等工程手段保障了模型实时运行,使理论优势转化为实际可用的机器人技能。

基线对比视角

区别于仅聚焦模型架构的 VLA 工作,HyVLA-0.5 强调了全栈协同的重要性。

  • 通用 VLA 模型常受限于互联网规模数据中的噪声与动作标注质量,而 Hy-UMI-10K 的专业高精数据从源头提升了监督信号强度。
  • 传统流匹配或扩散动作策略直接输出绝对关节角,在面对不同实施例时需重新训练;delta-chunk 表示形态无关的平台映射则实现了策略的快速复用。
  • 结合 RL 后训练,系统在真实交互中持续改善,这在纯模仿学习框架中难以实现。整体来看,该工作为构建实用化机器人学习堆栈提供了可复现的范例。

行业影响

落地场景

HyVLA-0.5 提供了一个完整的 端到端机器人学习栈,可直接赋能 高精度机器人操作 任务,如 柔性制造仓储物流分拣手术辅助实验室自动化。其 形态无关的 delta-chunk 动作表示 使策略能跨不同机器人平台迁移,尤其适合多品类、小批量的生产环境或需要频繁适应新任务的场景。

商业价值

  • 降本:大幅减少传统机器人编程与示教时间,仅需少量人类演示即可训练新技能,降低部署门槛和人力成本。
  • 增收:操作成功率与任务执行速度的提升直接提高产线吞吐量;RL 后训练 持续优化策略,在复杂场景中保持稳定性,增加有效产出。
  • 体验提升:在服务机器人(如辅助进食、精细装配)中,更自然的操作能力可改善人机交互体验,拓展机器人应用边界。

与现有产品/工作流的集成

HyVLA 采用 模块化设计

  • 数据侧:兼容 UMI 设备 与常规机器人传感器(相机、关节角),通过标准化流接入。
  • 模型侧:预训练权重可经 Hugging Face 等平台分发,支持以 LoRA 等方式微调适配具体形态,无需从头训练。
  • 部署侧:提供 ROS 2 节点gRPC 接口与 异步执行 模块,可无缝嵌入主流机器人中间件(如 ROS、ROS 工业);latency-aware Bézier chunk stitching 确保实时控制。

具体落地示例

  1. 电商仓库商品拣选
    面对海量异形商品,传统视觉抓取系统难以维持高成功率。利用 HyVLA,仓库工程师可通过便携 UMI 设备采集少量人工演示,快速训练适应新品类的抓取策略,并通过 RL 后训练 优化在动态货架中的避障与放置精度,使自动化拣选站更易维护和扩展。

  2. 医疗手术机器人辅助
    在微创手术中,机器人需复现医生腕部的高精度动作。HyVLA 的 亚毫米精度 动作捕捉与 flow matching 动作专家 可学习专家操作轨迹,生成符合运动学约束的精细动作,并能在不同手术器械上泛化,降低手术机器人系统的开发周期与临床训练成本。

局限

  • **系统依赖昂贵的数据采集硬件**:HyVLA‑0.5 使用定制的指尖 UMI 设备和运动捕捉笼采集亚毫米精度演示,单次部署成本高且难以大规模复制;论文未讨论更低成本替代方案或仅用低成本遥操作时的性能退化,这限制了该堆栈在预算有限团队中的可复现性。
  • **跨形态泛化验证不足**:实验主要在双机械臂操作场景下进行,尽管架构声称解耦了具体机器人运动学,但未展示在人形机器人、移动操作或不同末端执行器上的定量结果,缺少对“形态无关”主张的严格支撑。
  • **现实强化学习后训练的边界条件不清晰**:论文提出 RL 后训练用于真实世界部署,但未系统分析安全约束、重置机制、探索噪声带来的硬件磨损风险,也未与纯遥操作微调基线做公平对比,RL 阶段的实际增益及剩余风险尚不明确。
论文He Zhang2026-06-12原文

相关内容