论文

OmniHumanoid: 无需配对适应的流式跨具身视频生成

跨具身视频生成旨在将运动在不同人形具身之间迁移,如从人到机器人、机器人到机器人,为具身智能提供可扩展的数据生成。主要挑战在于运动动态部分可迁移,而外观和形态是具身特有的。现有方法往往纠缠这些因素,且许多需要每个目标具身的配对数据,限制了向新机器人的可扩展性。 我们提出 OmniHumanoid ,一个将可迁移运动学习与具身特定适应分解的框架。该方法从跨多个具身的 运动对齐配对视频 中学习共享运动迁移模型,同时通过轻量级具身特定适配器仅使用未配对视频适应新具身。为减少运动迁移与具身适应之间的干扰,我们进一步引入 分支隔离注意力 设计,将运动条件与具身特定调制分离。此外,我们构建了一个包含不同人形资产、场景和视角渲染的运动对齐配对视频的 合成跨具身数据集 。 在合成和真实世界基准上的实验表明, OmniHumanoid 实现了强运动保真度和具身一致性,同时无需重新训练共享运动模型即可可扩展适应未见人形具身。

论文精读

TL;DR OmniHumanoid 解耦运动迁移与实体特定适应,仅用无配对视频即可让新机器人实体生成运动一致的视频,无需重训共享模型,大幅提升跨实体扩展的 scalability。

问题

问题背景

具身智能领域亟需可扩展的视频数据生成管线,以训练机器人的视觉运动策略。跨形态视频生成 (cross-embodiment video generation) 旨在将运动序列在不同形态 (如人形、机器人) 间迁移,从而利用已有数据合成多样化的具身交互视频,降低真实采集成本。

现有方法局限

既往工作常将运动动态形态外观紧密耦合,导致两个核心问题:

  • 成对数据依赖:多数模型要求为每个目标形态提供运动对齐的成对视频 (即相同运动在源、目标形态下的对应帧),这对新机器人而言采集代价极高,甚至不可行。
  • 耦合学习干扰:使用单一模型同时建模运动迁移和形态重建时,二者优化目标相互掣肘,常出现运动失真或形态纹理模糊,且无法灵活扩增新形态。

部分方法尝试通过解耦表征来缓解,但解耦粒度不足或仍需微调全部参数,难以做到 即插即用的形态适配

为什么这个问题难/重要

该任务的核心挑战在于 运动可迁移性与形态特异性的矛盾:运动动态 (如关节运动轨迹) 在智能体间部分共享,而外观、几何、运动学约束则是形态专属的。如何在仅使用未配对目标视频的条件下,将共享的运动知识注入新形态,同时避免污染形态特有特征,是一项精细的工程难题。

业界高度关注此问题,因为:

  • 可扩展的数据生成是 具身基础模型 落地的关键瓶颈,跨形态生成能显著减少真实机器人数据需求。
  • 泛化到新形态时无需重训完整模型,可大幅降低计算开销和部署周期。

行业类比

类似 CV 中的风格迁移,将内容 (运动) 与风格 (形态) 解耦,但本任务还需保持时序一致与物理合理性,难度更高;如同 NLP 中跨语言迁移,共享语义空间适配不同表面形式。

核心洞察

  • **解耦运动迁移与形态适应**: 以往跨形态视频生成方法往往将运动动态与外形/形态纠缠在一起,且需要为每个目标形态收集运动对齐的配对视频,导致扩展代价高昂。 OmniHumanoid 将可迁移运动建模与形态特定适应因子分解,共享运动模型仅在多形态配对数据上训练一次,对新形态只需未配对视频通过轻量适配器进行适应,无需重训基础模型。这种设计大幅降低了数据准备与计算成本,为具身智能中大规模视频数据生成提供了更可扩展的解决方案,且与现有主流方法相比,解耦思路使系统更模块化、易于维护和迁移。
  • **分支隔离注意力机制**: 在交叉形态视频生成中,运动条件与形态特定信息若在注意力计算中混合,常导致运动泄露或外观不一致。 OmniHumanoid 提出分支隔离注意力,将运动条件分支与形态调制分支显式分离,仅在必要阶段进行交互,显著减少了信息干扰。相比于以往单一注意力流的设计,该机制不仅提升了运动传递的保真度和生成视频的形态一致性,还为后续适配新形态提供了清晰的信号分离界面。 在工程实践中,这种显式分离使模型调试更直观,也有利于在其他条件生成领域(如多任务视频合成)中复用。

方法

整体框架与输入输出

OmniHumanoid 将跨具身视频生成拆分为两个核心阶段:共享运动迁移模型(Shared Motion Transfer Model)具身特定适配(Embodiment-specific Adaptation)。输入包括运动源视频(提供运动序列)和目标具身的视频数据(可以是真实机器人、虚拟人形等),其中目标具身仅需非配对视频,无需与源运动一一对应的配对样本。输出为一段视频流,目标具身自然复现源视频中的运动,同时保持该具身特有的外观与形态。

共享运动迁移:从多具身配对数据中学习可迁移运动

首先,利用合成跨具身数据集(该数据集在不同人形资产、场景、视角下渲染了运动对齐的配对视频,覆盖多种具身)训练一个共享的 运动迁移模型。该模型对运动动态进行因子化:通过 运动编码器 提取与具身无关的运动模式,再通过 外观-形态编码器 学习具身特有的视觉与结构信息。核心设计在于分支隔离注意力(Branch-Isolated Attention):将运动条件信号与具身特定调制分别送入独立的注意力分支,从而避免运动信号与形态外观在特征空间中相互污染。模型基于扩散架构(例如 video diffusion model),从噪声逐步生成帧序列,运动编码器的输出作为条件注入去噪过程。

轻量具身适配:无配对数据下的可扩展性

当遇到全新的目标具身时,OmniHumanoid 不重新训练共享运动模型,而是插入一组轻量的具身特定适配器(类似 Adapter 或 LoRA 式的可插拔模块),仅使用该具身的非配对视频进行微调。这些适配器分布在网络的多个层,负责调制特征以适应新具身的形态(如关节连接关系、身体比例)和外观(如纹理、颜色)。由于共享运动模型已习得跨具身通用的运动规律,适配时只需少量参数就能捕捉到新具身的个性化表现,从而实现流式生成

分支隔离注意力与解耦设计

分支隔离注意力的设计动机在于:传统方法常将运动条件与具身外观统一编码,导致运动传递时出现外观泄漏(如机器人身上出现人类纹理)或运动失真。OmniHumanoid 在扩散 U-Net 的每个注意力层中,为运动条件创建独立的 query/key/value 投影,与负责具身外观的注意力分支并行计算,最终通过门控融合输出。训练时,使用 运动对齐损失(如光流一致性)约束相邻帧间的运动平滑性,同时用 具身一致性损失 确保生成帧的具身视觉特征与真实视频匹配。

与同类方法的差异

与现有跨具身生成方法相比,OmniHumanoid 的差异在于:

  • 因子化解耦 + 无配对适配:无需为每个新具身收集昂贵且稀少的配对数据,仅靠非配对视频即可扩展。
  • 分支隔离注意力:显式分离运动与外观路径,比以往共享注意力或简单拼接的设计有更低的干扰风险。
  • 流式生成能力:训练分两阶段、适配参数轻量,推理时可组成视频流,适合持续产生机器人行为数据。

该方法对实际工程的启示在于:为具身智能的规模数据生产提供了一种低成本、高保真的合成方案,模型部署时可通过热插拔适配器快速支持新机械平台,无需从头重训。

实验

实验设计

OmniHumanoid 通过因子化解耦将运动迁移与具身特定适应分离。首先在合成的运动对齐配对视频数据集上训练共享运动迁移模型,该数据集涵盖多种人形资产、场景和视点。然后,对未见过的具身,仅使用未配对视频微调轻量级的具身特定适配器,无需重训共享模型。为减少干扰,引入分支隔离注意力,将运动条件与具身调制分离。评估在合成和真实世界基准上进行,关键指标包括运动保真度具身一致性

关键发现

  • 因子分解与分支隔离显著降低了运动与外观学习之间的冲突,使模型对运动动态的迁移更精准,同时保持具身外观的忠实度。
  • 在新具身上,仅通过未配对数据就能快速适应,无需收集昂贵的配对运动-外观样本,大幅提升可扩展性。
  • 轻量级适配器设计使得适应成本极低,且不会损害已学好的运动迁移能力,实现“即插即用”。
  • 在合成和真实场景中,生成视频的运动时序连贯,具身形态和纹理保持稳定,极少出现伪影。

与基线对比解读

与需要目标具身配对数据的方法(如直接端到端训练或逐机器人微调)相比,OmniHumanoid 在未配对适应设置下仍能达到甚至超越其运动保真度和视觉质量。传统方法每增加一个新机器人,都需要重新采集大量对齐数据,扩展性差。OmniHumanoid 通过解耦与分支隔离注意力,打破了这一瓶颈,使得新具身适应仅需少量未配对数据,且共享运动模型保持固定。这种设计对实际工程部署尤为友好:当引入新型号机器人时,只需录制其随机动作视频即可完成生成能力迁移,避免重复训练整个生成管线,显著降低了数据与计算成本。

行业影响

落地场景

OmniHumanoid 的跨具身视频生成能力可应用于多个实际业务:

  • 机器人仿真与训练数据生成:具身智能公司需要大量运动数据训练人形机器人。该框架可将人类动作视频迁移到目标机器人模型,生成带标注的动作-视频对,减少对昂贵遥操作或真实采集的依赖。
  • 内容平台与数字人:视频平台可借助模型生成相同动作但不同外观的数字人视频,用于虚拟主播、广告素材快速置换。只需一段参考视频即可驱动多种角色。
  • 游戏与影视动画:从已有动作模板生成不同形态角色的动作序列,无需重复调整骨骼绑定,加速预演与创意迭代。

商业价值

主要价值体现在降本增效

  • 降低数据采集与标注成本:传统跨具身迁移常需动作对齐的配对视频(例如同时记录人类与机器人执行同一动作),对新型机器人难以规模化。OmniHumanoid 仅需目标具身的非配对视频,通过轻量具身专用适配器实现迁移,大幅减少对新机器人配对数据的需求。
  • 加速具身智能模型迭代:借助合成数据,研发团队可快速扩充训练集,缩短算法开发周期,加快产品上市速度。
  • 提升视频生成灵活性:内容制作方可一键替换角色外观,保持动作一致性,提高创意生产效率,可能带来新的营收流(如定制化虚拟形象)。

与现有产品/工作流的接口

OmniHumanoid 可通过以下方式集成到现有技术栈:

  • API 化部署:封装为推理服务,接收参考视频与目标具身描述,输出生成视频。可对接云 GPU 集群,支持流式生成(Streaming)。
  • 与仿真平台结合:与 NVIDIA Isaac Sim、MuJoCo 等仿真器联动,将仿真渲染视频作为输入,利用 OmniHumanoid 进行动作迁移,生成不同视角或形态的仿真数据,补充域随机化。
  • 数据管线嵌入:在现有的数据标注平台或 MLOps 管道中,将 OmniHumanoid 作为预处理组件,自动将原始动作数据转换为多具身格式,输入到下游导航、操作等模型的训练中。

具体落地 use case

  1. 机器人公司研发新型人形机器人:假设某公司开发了一款新型双足机器人,但缺乏与人类动作对齐的视频。通过拍摄一段该机器人执行简单动作的视频(如行走),OmniHumanoid 的具身适配器可从公开的人类动作数据集中学习迁移映射,生成该机器人模仿各种复杂动作(如跳舞、搬运)的视频。这些合成视频可作为视觉逆强化学习或模仿学习的训练集,帮助机器人快速掌握新技能,无需为每个动作采集真实机器人数据。

  2. 短视频平台虚拟人内容生产:内容创作者上传一段自己跳舞的视频,平台利用 OmniHumanoid 将其动作迁移到多个预置虚拟形象上,生成多角色同步舞蹈的短视频。创作者无需掌握 3D 动画技能,即可获得风格化内容,提高用户参与度和平台内容多样性。

局限

  • **合成数据集的局限性**:论文依赖大规模合成渲染数据以提供运动对齐配对视频,但虚拟渲染与真实世界的视觉域差异(如光照、材质、传感器噪声)可能导致 sim-to-real 迁移性能下降。此外,构建涵盖多样人形形态、场景和视角的合成管线本身需要高昂的计算资源和人工设计成本,限制了方法的快速推广。尽管作者在部分真实基准上做了验证,但并未系统分析合成数据分布偏差对下游具身智能任务的影响。
  • **分支隔离注意力的信息交互受限**:提出的分支隔离注意力设计刻意分离运动条件与形态特定调制,虽减少了干涉,但也可能阻碍运动特征与形态细节之间的必要交互,尤其对于需要精确物理约束的动作(如接触密集型操作)。当前实验主要在简单运动(行走、挥手等)上验证,未探讨更复杂的灵巧操作或动态地形穿越场景。此外,适配新形态时虽无需配对数据,但轻量适配器的容量有限,可能难以捕捉颠覆性的形态差异(如大幅改变自由度或关节布局),泛化到非拟人形态时效果存疑。
论文Yiren Song2026-05-12原文

相关内容