论文

Hydra-0: 通用世界建模与控制的动作流

Hydra-0: 通用世界建模与控制的动作流

本文提出 Hydra-0,一种以动作流为条件的通用世界模型,它将机器人动作表示为像素运动。这种共享视觉接口通过跨具身、任务、环境和视频生成骨干学习动作后果,实现了通用世界建模与控制。 我们的最佳配置相比动作条件基线,将机器人运动误差降低 90.4%,物体运动误差降低 60.2%,同时支持零样本组合和数据高效适配。在 RoboLab 基准上,Hydra-0 的重放成功率与参考成功率之间达到了 皮尔逊相关系数 r=0.96。 此外,我们还发现了该接口的一种涌现逆模式:一种世界动作模型,能够根据从人类演示中迁移的期望物体流预测兼容的机器人运动。训练好的动作头将所得潜在特征映射为可执行动作,无需特定任务的专业机器人演示。 这些结果共同证明了动作流作为一种共享控制接口的潜力,可连接异构训练数据、开环策略评估和机器人控制。

论文精读

TL;DR Hydra-0 将机器人动作统一表示为像素运动(action flow),训练跨实施例、任务与视频 backbone 的通用世界模型,使机器人运动误差降低 90.4%,并支持零样本组合与逆向控制。

问题

问题背景

机器人学习领域正从单一任务策略转向通用世界模型,希望以统一的动作接口预测动作后果,支持跨任务、跨 embodiment 的规划与开环评估。

现有方法局限

传统机器人世界模型的动作条件多为关节角、末端位姿或离散动作 token,导致:

  • 跨 embodiment 泛化差:不同机器人的动作空间不一致,难以共享一个模型。
  • 缺乏几何一致性:动作对像素级运动的影响(如物体移动、遮挡)未被显式建模,预测误差大。
  • 难以利用异构视频数据:真实操作视频中只有像素运动,没有显式动作标注,现有方法无法直接对齐。

作者指出,基线方法仅用动作条件预测视频,Robot-motion error 和 object-motion error 都较高,说明仅靠动作向量难以捕捉像素级动态。

为什么这个问题难/重要

难点在于需要一种动作表示同时满足:

  1. 几何可解释:动作对应像素运动,便于跨场景迁移和零样本组合。
  2. 可逆:能从期望的物体运动反推兼容的机器人动作(即文中发现的逆模式)。
  3. 与视频生成骨干兼容:可插入不同预训练视频模型,实现多 embodiment 数据的高效利用。

业界关注度体现在:通用机器人基础模型需要统一接口来吸收大规模、多来源的交互数据,否则只能训练专用小模型,无法形成规模效应。

行业类比

类似文本 token 化统一了多语言与多任务输入,action flow 试图成为机器人动作的“视觉 token”,让世界模型像处理语言一样处理物理交互。

核心洞察

  • Action flow 将机器人动作统一表示为像素运动,作为跨 embodiment 的共享视觉接口,使世界模型能够从异构数据中学习动作后果。与传统的 action-conditioned baseline 相比,这一表示将动作置于与观测相同的视觉域,消除了不同机器人关节空间、末端位姿等异构动作表示的对齐难题。它天然适配视频生成骨干,可混合不同机器人、任务和环境的数据进行联合训练,实现零样本组合与快速适应,机器人运动误差降低 90.4%。
  • Hydra-0 的逆向模式可从期望物体流反向预测机器人运动,实现从人类演示到机器人控制的零样本迁移。该能力源于 action flow 的双向映射:正向用于策略评估,逆向通过世界动作模型将人类视频中的物体运动流转换为机器人可执行动作。与传统需要任务特定专家演示的模仿学习不同,这一模式仅需人类操作视频和目标物体流,即可训练动作头输出可执行指令,大幅降低数据采集门槛,展示出通用控制接口的潜力。
  • 开环策略评估通过世界模型回放成功率与真实成功率的强相关性(Pearson r=0.96),为策略筛选提供了低成本、高保真的代理指标。在 RoboLab 基准上,Hydra-0 回放的成功率与参考成功率几乎线性相关,说明 flow-conditioned 世界模型能够准确模拟策略执行后的视觉结果。这使工程师可以在大规模并行仿真中快速评估候选策略,仅对少数高潜力策略进行真实机器人验证,减少物理实验次数和成本,同时保持评估置信度。

方法

方法概览\n\nHydra-0 的核心是将机器人动作统一表示为像素运动(action flow),并以此作为条件训练通用世界模型。\n\n输入:多模态机器人示范数据或人类演示视频,动作被提取为二维光流场。构造方式包括几何感知构造(利用相机参数与深度将关节运动投影到像素平面)和仅视频构造(直接从视频中学习运动对应),训练时通过随机采样不同来源的 flow 来增强泛化。\n\n关键模块:\n\n1. Action-Flow-Conditioned Video Prediction:以 action flow 作为条件,输入到视频生成骨干(如Cosmos 2.5、Wan2.2 I2V-A14B)中,目标是预测未来视频帧。学习目标基于视频扩散损失,使模型能够建模动作导致的场景变化。\n2. 高效因果 Rollout:通过自回归转换将视频生成模型适配为因果预测器,并用少步蒸馏减少推理步数,提升长时 rollout 速度。\n3. 开环策略评估与逆控制:正向模式直接用 world model 评估给定策略的效果;逆向模式作为一个世界动作模型,从人类示范中提取的期望物体 flow 出发,预测兼容的机器人动作流,再通过一个动作头映射到可执行动作,无需专家机器人示范。\n\n输出:未来视频帧(用于闭环仿真与策略评估)或机器人动作(用于现实控制)。\n\n差异点:与使用文本、关节角度等异构条件的世界模型不同,Hydra-0 用 action flow 作为共享视觉接口,天然支持跨 embodiment、跨任务和跨视频骨干的迁移与零样本组合。

实验

实验设计

Hydra-0 在 RoboLab 基准上评估,涵盖多 embodiment 和任务。与动作条件基线对比,测试零样本组合 与数据高效适应 能力。评估指标包括机器人运动误差、物体运动误差,以及回放与参考成功率的 Pearson 相关系数。逆模式实验中,从人类演示提取期望物体流,训练动作头预测机器人动作,无需任务特定专家演示。

关键发现

  • 最佳配置相比动作条件基线:机器人运动误差降低 90.4%,物体运动误差降低 60.2%
  • 开环策略评估:RoboLab 上回放与参考成功率的 Pearson r = 0.96,表明开环评估可靠性高
  • 涌现逆模式:世界动作模型可由期望物体流预测兼容机器人运动,动作头将潜在特征映射为可执行动作,无需专家机器人演示

与基线对比解读

动作条件基线通常以显式动作向量为条件,跨 embodiment 泛化差。Hydra-0 采用动作流(像素运动) 作为统一接口,直接学习视觉后果,显著降低运动误差,证明该接口在异构训练数据下的有效性。零样本组合与数据高效适应能力进一步表明,动作流可以桥接不同视频生成骨干和机器人平台,降低对大规模配对专家数据的依赖。逆模式的发现为从人类视频迁移控制信号提供了新路径。

行业影响

落地场景

Hydra-0 的 action flow 接口将机器人动作编码为像素运动,可作为通用世界模型直接用于具身智能数据合成、开环策略评估 与跨本体模仿学习。典型场景包括:

  • 仓储 / 物流机器人:利用视频生成骨干批量合成不同货架布局下的抓取、搬运视频,扩充训练集。
  • 自动驾驶仿真:预测自车动作后的未来场景流,用于规划器预验证,减少实车测试里程。
  • 服务机器人产品:从人类演示视频中提取期望物体运动,逆向生成可执行动作,加速新任务部署。

商业价值

核心降本路径是减少真实机器人数据采集与人工标注成本。论文显示机器人运动误差降低 90.4%,且在 RoboLab 上策略评估相关性 r=0.96,意味着离线仿真评估可信度大幅提升,可减少真机调试迭代次数。对仓储自动化厂商,减少采集小时数直接转化为硬件与人力节省;对自动驾驶,降低实车路测风险与费用。同时跨本体泛化能力让同一世界模型服务多款机器人型号,摊薄研发成本。

与现有工作流集成

  • 数据管线:可作为预训练数据生成器,输出 (observation, action_flow, next_observation) 三元组注入现有模仿学习或强化学习框架。
  • 评估环节:替代部分真机 rollout,用 action flow 条件视频预测做开环策略评估;RoboLab 基准可嵌入 CI 流程,设置成功率回归阈值。
  • 控制接口:逆模式(world action model)输出可与现有动作头(如 RT 系列策略)对接,只需额外训练轻量映射网络,无需任务特定专家演示。

具体落地示例:电商仓储中,用 Hydra-0 对机械臂拾取新 SKU 生成合成交互视频,先离线训练策略,再少量微调即可上线;自动驾驶感知团队可将其作为神经仿真器,快速验证变道决策对不同障碍物流的响应。

局限

  • **计算与实时性瓶颈**: Hydra-0 基于大规模视频生成 backbone(如 Cosmos 2.5 / Wan2.2),单次推理计算成本高,即使采用 few-step distillation 和 autoregressive conversion,仍难以满足高频闭环控制(>50 Hz)的实时性要求。世界模型在仿真中可离线评估,但部署到真实机器人时,推理延迟会直接影响控制性能。若用于 policy evaluation 或 model predictive control,需要进一步压缩模型或采用异步预测策略,这在实际工程中仍是一个开放问题。
  • **Action flow 构造依赖光流质量**: 训练和推理中的 action flow 需要从视频或仿真几何信息中提取,视频-only construction 依赖光流估计,而光流在快速运动、遮挡、弱纹理、光照变化等场景下会产生显著误差。这些误差作为条件输入会直接污染世界模型的预测,导致机器人动作与物体运动不一致。虽然论文提出 geometry-aware construction 缓解部分问题,但在真实世界非结构化环境中,鲁棒的光流估计仍是薄弱环节,限制了方法的即插即用能力。
  • **跨 embodiment 与真实世界泛化证据有限**: 实验主要在 RoboLab 仿真基准和少数真实机器人场景中验证,跨 embodiment 泛化虽展示了零样本组合与数据高效适应,但所用 embodiment 数量和任务多样性可能不足以支撑 "generalist" 宣称。此外,inverse mode 依赖人工演示的 desired object flow,获取成本较高,且从 human flow 到 robot action 的映射在复杂接触丰富任务中是否稳定尚不明确。与直接使用 language instruction 或离散 action token 的世界模型相比,缺乏系统性的 head-to-head 对比,难以全面评估相对优势。
论文Hongyu Li2026-08-18原文

相关内容