论文

Humanoid-GPT: 扩展数据和结构以实现零样本运动跟踪

Humanoid-GPT: 扩展数据和结构以实现零样本运动跟踪

现有全身运动跟踪方法多采用浅层 MLP 追踪器,受限于数据稀缺与敏捷性-泛化权衡,难以处理高度动态行为并泛化到未见任务。为此,我们提出 Humanoid-GPT,一种采用因果注意力的 GPT 风格 Transformer,在十亿帧规模的 运动语料库 上预训练。 该语料库通过 重定向 技术统一了所有主流 mocap 数据集(如 CMU、Human3.6M 等)并融入大规模内部录制数据,总计 20 亿帧。通过同时扩展数据容量与模型规模,Humanoid-GPT 学习到强大的运动先验,能够跟踪高度动态行为,并展现出前所未有的 零样本泛化 能力。 大量实验与扩展性分析表明,Humanoid-GPT 建立了新的性能前沿:在无需微调的情况下,即可直接泛化到未见运动和控制任务,同时保持对复杂动态行为的精确跟踪。

论文精读

TL;DR Humanoid-GPT 将 GPT 架构与十亿帧运动数据缩放,实现零样本全身运动跟踪,突破传统浅层网络的敏捷性-泛化瓶颈。

问题

问题背景

人形机器人全身运动跟踪的目标是让机器人实时复现复杂人体动作,是实现通用具身智能的关键能力。当前领域关注的核心是泛化性:如何让单一模型直接应对任意新运动,而无须针对特定动作或任务重新训练。

现有方法局限

此前主流的浅层 MLP 追踪器存在两个根本瓶颈:

  1. 数据规模不足:受限于动捕采集成本,训练数据通常仅涵盖数个公开数据集,运动多样性有限,模型难以学到鲁棒的运动先验。
  2. 敏捷性-泛化性权衡:由于模型容量小、表征能力弱,往往只能在“跟踪高动态运动”或“泛化到多风格”之间妥协——擅长一项则另一项表现骤降。

这些方法属于“小数据+小模型”范式,无法从海量运动序列中自动提取通用模式,导致面对未见过动作时性能崩溃,或需要反复进行任务级微调。

为什么这个问题难/重要

技术挑战在于:

  • 高维控制空间:人形机器人动辄几十个自由度,运动序列的时间依赖性与物理约束复杂,需要模型同时理解运动语义与底层动力学。
  • 数据规模化悖论:收集并标注数十亿帧的运动数据成本极高,且需保证数据格式统一、重定向精度,否则噪声会损害模型性能。
  • 预训练范式迁移:在语言与视觉领域,“规模法则”已被证明是通向泛化的可靠路径,但在机器人运动控制中如何设计可扩展的数据管道、模型架构与训练目标仍是开放问题。

解决该问题意味着有望构建通用运动基础模型,大幅降低机器人学习新技能的门槛,推动人形机器人在物流、服务等动态场景中的落地。

行业类比

类似大型语言模型通过海量文本预训练获得零样本任务能力,人形机器人运动跟踪同样可能通过十亿级运动语料预训练,实现“给定任意运动描述即可执行”的通用运动生成与控制。

核心洞察

  • **规模化重构运动跟踪的泛化范式**:以往人形运动跟踪依赖浅层 MLP,始终面临敏捷性与泛化能力之间的权衡,仅能处理训练分布内的有限行为。Humanoid-GPT 通过将 GPT 式因果注意力 Transformer 与 **20 亿帧** 多源运动数据结合,使单一模型同时具备高动态运动跟踪与零样本任务泛化能力。这与语言 / 视觉领域“规模解锁涌现能力”的发现一致——数据与模型容量的扩张使得模型能够内化物理运动模式,而非简单记忆,从而在未见任务上展现强劲的泛化。对工程而言,这证明了为机器人控制构建大规模基础模型的可行性,未来可通过持续扩展数据和参数来提升性能。
  • **数据多样性与表示学习的平衡**:Humanoid-GPT 的关键不在于数据量的简单堆积,而在于通过 **谐波运动嵌入 (Harmonic Motion Embedding)** 将不同骨架、风格、场景的运动捕捉数据统一为规范化的关节旋转表示,并精心平衡数据来源(公开数据集 + 大规模自采集)。这种多样性平衡可防止模型偏向单一模式,使 Transformer 在预训练中学习到足够丰富的运动先验。相较于传统只使用单个或少数数据集的做法,该方案显著提升了零样本跟踪的鲁棒性,并降低了在线微调需求。这启示工程师:构建通用机器人基础模型时,数据策展(curation)与表示标准化至少与模型结构同等重要,直接决定模型的下游泛化边界。

方法

数据策展与运动表示

  • 统一动作数据:将主流动捕数据集与企业大规模内部录制统一至同一个人形机器人运动学模型,通过重定向生成 2B 帧的运动语料。
  • 谐波运动嵌入 (Harmonic Motion Embedding):对每个时间步的姿态进行频率编码,将关节旋转映射为高频谐波特征,增强 Transformer 对快速动态变化的感知能力。

多专家策略训练 (RL Experts)

  • 针对不同运动类型(如行走、跳跃、舞蹈)分别训练多个强化学习专家,每个专家是一个浅层 MLP 策略,专门优化特定运动类别的跟踪精度。
  • 使用模拟环境进行 PPO 训练,奖励函数结合姿态误差、速度跟随、能耗等项。训练过程产生大量 状态-动作对 用于后续蒸馏。

DAgger 蒸馏与数据集构建

  • 采用 DAgger (Dataset Aggregation) 迭代策略:在模拟中让当前模型(初始为 RL 专家)执行动作,记录访问的状态,再由专家重新标注动作,逐步扩充训练集。
  • 结合多个专家的数据,形成覆盖广泛运动分布的离线跟踪数据集,为大规模 Transformer 训练提供监督信号。

生成式 Transformer 跟踪器

  • 架构:GPT 风格的自回归 Transformer,使用因果注意力掩码,输入为一段历史的运动嵌入与本体感觉(关节位置、速度等),输出下一个时间步的关节目标位置。
  • 训练目标:最小化预测关节目标与专家动作之间的均方误差,本质上是一个序列预测任务。通过扩大模型参数量与输入历史长度,模型学会从过去上下文推断当前控制指令。
  • 在线推理:仅需提供当前的运动目标序列(如未来几帧的参考姿态),模型根据历史状态自回归生成控制动作,无需在线优化或微调。

与同类方法的差异

相比之前普遍使用浅层 MLP+小规模数据、并在“敏捷”与“泛化”间难以兼顾的工作,Humanoid-GPT 将问题转化为大数据驱动的序列建模,利用 Transformer 的容量与长上下文记忆实现单一模型零样本泛化到多种未见运动与任务,不再需要按运动类型切换专家或手工设计层次结构。

实验

实验设计

Humanoid-GPT 基于 20 亿帧重定向运动语料库(融合主流动捕数据集与自采数据)进行预训练,采用 GPT 风格 Transformer因果注意力,构建全身控制的生成式追踪器。在训练过程中引入 DAgger 蒸馏、多专家迁移学习,并通过合成与真实机器人评估零样本能力。消融实验考察数据多样性、专家数量、上下文长度等变量的影响。

关键发现

  • 规模突破:数据和模型容量的扩展使单一的生成式 Transformer 能够同时追踪高动态动作并泛化到全新任务,打破了以往浅层 MLP 追踪器的敏捷‑泛化折衷。
  • 零样本性能:在未见的复杂运动和未见控制任务上,Humanoid-GPT 显著超越基线,展现出稳健的实时跟踪能力,且在真实机器人部署中验证了方法的可行性。
  • 扩展律:性能随数据和模型规模的增加单调提升,表明该任务同样遵循“规模法则”,预示更大规模的预训练可能解锁更强能力。

与基线对比解读

相比传统基于 MLP 的动作追踪器(受限于数据稀缺且需手动平衡敏捷与泛化),Humanoid-GPT 通过海量多源数据预训练大容量自回归架构,从根本上放宽了泛化假设。模型不再依赖精细的任务特化微调,而是将追踪建模为条件生成问题,使得在未见运动、任务和环境设置下直接输出合理动作序列成为可能。这一路线证实:在类人运动控制中,规模化的数据和模型设计是通向通用全身行为的关键路径,而非特定的网络结构或奖励工程。

行业影响

落地场景

Humanoid-GPT人形机器人全身控制高质量虚拟角色动画提供了统一的生成式模型。游戏开发、影视特效、虚拟现实(VR)/增强现实(AR)交互中,存在大量高动态、强风格的动作生成需求;该模型可直接用于动捕数据驱动的实时数字人驱动,或作为物理仿真环境中的人形代理决策器,赋予机器人零样本适应新任务的能力。在遥操作、危险环境作业等非结构化环境中,其零样本泛化可让机器人基于惯性传感器或视频输入直接复现参考运动。

商业价值

降本角度,传统动作生成依赖大量动捕标注与逐任务强化学习训练,Humanoid-GPT 通过十亿帧规模预训练因果注意力将成本压缩至单一模型一次推理,省去重复的专家训练。从体验提升角度,模型对未见动作、未见任务的稳健追踪能力可显著减少虚拟角色穿模、滑步等异常,增强用户沉浸感。在机器人产品线中,其缩放定律(数据与模型规模)暗示持续投入数据即可获得可预测的性能增益,为长期研发提供路线图。

与现有工作流集成

Humanoid-GPT 可作为状态-动作映射器直接嵌入控制栈:输入历史运动嵌入与当前状态,输出目标关节角度。其因果 GPT 架构天然适配在线流式应用,可与 ROS 2 等机器人中间件或游戏引擎(如 Unity、Unreal)通过插件集成。预训练权重与DAgger 蒸馏策略支持下游任务微调,团队可将自有风格数据注入谐波运动嵌入空间快速适配,无需重建完整训练流程。

具体用例

  • 虚拟主播与实时表演:直播平台中,仅需单目摄像头或少量 IMU 信号,Humanoid-GPT 即可驱动高保真 3D 虚拟人执行任意舞蹈、武术等复杂动作,零样本泛化避免预置动作库的单调感,降低实时动作合成延迟。
  • 工业人形机器人自主操作:仓储场景中的双足机器人更换操作流程时,无需重新训练控制策略;模型根据任务描述(如“拿起箱子并放置于货架”)预测全身协调动作,显著缩短部署周期。

局限

  • - **域迁移与数据依赖**:预训练依赖大规模重定向运动数据与谐波运动嵌入,当面对原始传感器输入或多模态环境时,模型能否保持泛化能力尚不明确。未见分布的运动类别(如极限体操、多人交互)仍可能导致跟踪失败,而论文未系统评估分布外鲁棒性。对高质量动作捕捉设备的隐式假设限制了其在低资源场景下的应用。
  • - **任务与平台泛化**:Humanoid-GPT 被设计为纯运动跟踪器,未展示其作为下游任务(如操作、导航)的基础模型的潜力。强化学习专家训练和 DAgger 蒸馏需要针对每种机器人形态从头进行,模型迁移到不同动力学参数的平台时,性能可能显著退化。论文未给出跨形态迁移(例如从人形到四足)的扩展路径。
  • - **基线对比与实用性**:对比方法主要为浅层 MLP 跟踪器,缺少与基于物理模型的控制器(如 MPC)或现代端到端强化学习策略的全面比较。缺少安全约束、碰撞避免等指标的评估。模型的因果注意力序列长度和参数量可能带来较高的推理延迟(论文提及了延迟测量但未与紧凑基线对比),对毫秒级实时控制构成的挑战尚未完全解决。
论文Zekun Qi2026-06-02原文

相关内容