论文

ARDY: 基于混合表征的自回归扩散用于交互式人体动作生成

ARDY: 基于混合表征的自回归扩散用于交互式人体动作生成

生成真实感3D人体动作并实现实时交互,对动画、仿真和类人机器人领域至关重要。现有离线方法通过文本和运动学约束提供精确控制,但推理速度不足;在线方法虽能实时合成,却往往牺牲可控性,或受限于上下文窗口难以处理复杂文本语义与长程目标。 本文提出 ARDY,一种流式生成框架,通过混合表征(结合显式根特征与隐式身体嵌入)平衡精确轨迹控制与高效生成学习,并支持在线文本提示与灵活的运动学约束。模型采用两阶段自回归Transformer去噪器,具备可变历史上下文,可适应灵活的长程运动学约束。在大型运动捕捉数据集上训练时,直接以文本标签和从真实姿态采样的运动学约束为条件,使ARDY原生支持可控生成,实现在线提示与灵活长程目标。 在 HumanML3D 基准与大规模高保真 Bones Rigplay 数据集上的大量评估表明,ARDY实现了高动作质量与约束遵循,验证了关键架构设计的有效性。最后,通过包含动态文本控制、多样关键帧姿态约束、路径跟随以及鼠标/键盘交互式运动控制的交互演示,展示了该方法的多功能性。

论文精读

TL;DR ARDY 通过混合运动表示与两阶段自回归扩散,首次让实时人体运动生成兼具高保真与灵活的文本、运动学约束控制,弥合了离线精度与在线速度之间的鸿沟。

问题

问题背景

交互式 3D 人体运动生成是动画、仿真、人形机器人领域的核心需求,要求实时响应文本与运动学约束,驱动自然、可控的动作合成。

现有方法局限

  • 离线方法(如基于扩散的 MDM、MLD)通过文本或关键帧实现精确控制,但生成耗时(秒级),无法满足 5–30 FPS 的流式交互需求。
  • 在线方法(如自回归 Transformer)虽然推理快,却常因固定上下文窗口难以维持长序列一致性,对复杂文本语义(如“先走再跳”、multi-step 指令)和长期目标(如持续路径跟随)控制力弱。
  • 表示层面,纯隐式(latent)难以精确施加根轨迹约束,纯显式则丢失运动细节并降低生成多样性,两者难以兼顾。
  • 此外,现有在线模型大多不支持运动过程中动态切换文本提示或插入关键帧约束,交互灵活性不足。

为什么这个问题难且重要

  1. 实时与高质量的冲突:扩散模型虽然生成质量高,但迭代去噪天然慢;自回归模型虽快,却容易漂移。在保证 30 FPS 以上的前提下生成连贯、合乎物理的动作极具挑战。
  2. 多模态控制融合:将文本语义、空间路径、关键帧姿态等异构信号统一注入生成过程,并允许在线动态修改,要求模型具备灵活的注意力与条件机制。
  3. 长时域一致性:交互可能持续数分钟,模型需利用可变历史上下文避免动作跳变,同时不引入累积误差。
  • 业界关注度极高:无论是游戏 NPC、虚拟主播还是仿真机器人,都急需可实时交互、高保真、多控制方式的运动生成引擎。

行业类比

该问题类似于流式对话生成需要实时理解并执行动态变化的意图,同时保持行动连贯,但输出的是物理运动序列而非语言。

核心洞察

  • **混合表示通过分立显式根轨迹与隐式身体潜变量,解决了交互式运动生成中精确控制与生成质量难以兼得的矛盾。** 现有方法要么采用全显式关节坐标,能精确约束但引入高维噪声、生成质量差;要么使用全隐式潜变量,生成质量高但难以施加空间约束。ARDY 将根位移、朝向等运动学目标保留为显式参数,而将身体姿态压缩到变分自编码器 (VAE) 的连续潜空间中进行扩散生成,从而在根轨迹级别的精确 keyframe 控制与肢体动作的逼真多样性之间取得平衡。这种设计使得在下游交互应用中,用户可以独立调整根运动路径,同时自动获得自然且符合文本语义的身体动作,无需为不同约束类型设计相互冲突的损失项。
  • **两阶段自回归 Transformer 去噪器通过分离空间目标条件与时间序列去噪,首次在流式生成中支持灵活的长时域运动学约束。** 传统在线方法受限于固定或滑动窗口,无法处理跨越数秒的稀疏关键帧或路径点。ARDY 将扩散去噪拆分为 '空间条件预测' 和 '时间自回归去噪' 两个交替阶段:第一阶段根据当前上下文预测未来时刻的根状态条件,第二阶段在该条件下对动作潜码进行去噪,并将其输出作为下一时间步的历史输入。这种交错设计使得模型在生成过程中可以随时插入新的目标约束,即使这些约束间隔远大于模型感受野,也能通过预测性条件传播到后续帧,从而实现实时交互中对长时域目标 (如 5 秒后的到达点) 的稳定跟踪,显著区别于只能针对相邻帧进行控制的现有方案。

方法

ARDY 采用 流式自回归生成框架,整体遵循“输入 → 关键模块 → 输出”的管线:

输入与条件

  • 文本描述:在线提供的自然语言动作提示,例如“行走并转向”。
  • 运动学约束:可选的灵活长时目标,如关键帧姿态、路径点或末端执行器位置,支持实时调整。
  • 历史动作:过去帧的动作状态,用于自回归预测。

关键模块

  1. 混合运动表示 (Hybrid Motion Representation)

    • 将人体运动分解为 显式根特征 (explicit root features)(全局位置、朝向)和 潜身体嵌入 (latent body embedding)
    • 根特征直接满足轨迹约束,身体嵌入通过 动作分词器 (Body Motion Tokenizer) 压缩为分块潜码,提升生成效率与质量。
  2. 两阶段自回归 Transformer 去噪器 (Two-Stage Autoregressive Transformer Denoiser)

    • 阶段一:以可变长度历史上下文和条件(文本、空间目标)为输入,生成下一时间步的噪声潜码与根特征。
    • 阶段二:对阶段一输出的潜码进一步去噪细化,通过 交错式两阶段设计 (Interleaved Two-Stage Denoiser) 平衡速度与精度。
    • 采用 空间目标条件 (Spatial Goal Conditioning),将未来位置约束编码为 Transformer 的 extra input,确保长时序动作的一致性。
  3. 训练策略

    • 基于大规模动捕数据(如 Bones Rigplay),直接从真值姿态采样文本标签与运动学约束作为条件,无需额外标注器。
    • 联合训练动作分词器和去噪器,损失函数兼顾重建质量与约束遵循。

输出与差异

  • 每一步输出下一帧的根轨迹与身体姿态,实现 实时流式生成
  • 相比于离线方法(如 MDM),ARDY 支持在线交互;相比现有在线方法,其混合表示与两阶段去噪显著提升了对文本语义、长时运动学约束的可控性,克服了上下文窗口受限的问题。

实验

实验设计

  • 在两个数据集上评估:HumanML3D (通用运动生成基准) 和 Bones Rigplay (大规模高保真运动捕捉数据),后者包含丰富文本标签与运动学约束。
  • 约束采样直接使用真实姿态的运动学约束和文本描述,训练时原生支持在线提示与灵活的长程目标。
  • 评估指标覆盖运动质量(FID、多样性等)和约束遵循度,通过消融实验验证 混合表示两阶段去噪器全局到局部转换 的必要性。
  • 基准对比分为离线模型和自回归模型两组,同时提供交互式 demo 的用户体验验证。

关键发现

  • 混合运动表示:显式根特征结合潜在身体嵌入,在精确轨迹控制与生成学习效率间取得平衡,优于纯显式或纯潜表示。
  • 两阶段自回归 Transformer 去噪器:可变历史上下文与长程运动学约束的条件注入,使 ARDY 能在流式生成中保持高质量帧间一致性,并实现复杂语义下的长序列生成。
  • 消融实验表明:移除混合表示会导致约束遵循度下降,去掉两阶段设计使生成质量波动增大;更大的词表容量和合适的 patch 尺寸能进一步提升性能。
  • 交互 demo 展示了动态文本切换、关键帧姿态控制、路径跟随和键鼠操控,验证了方法在实时应用中的通用性和低延迟(推断速度达实时级别)。

与基线对比解读

  • 相比离线方法(如 MDM、MLD),ARDY 的流式生成模式使其推断延迟大幅降低,可直接部署于交互环境,而文本和约束的控制精度未明显下降。
  • 相较于在线方法(如实时运动匹配或简单自回归模型),ARDY 凭借 可变历史窗口两阶段扩散,能够处理更长程的文本语义和精准的运动学目标,克服了以往在线方法在复杂长任务上的退化问题。
  • 在 HumanML3D 基准上,FID 和多样性等指标与离线 SOTA 持平或略有优势,同时在 Bones Rigplay 上的约束遵循评分显著优于其他实时方法,证明了架构设计的有效性。

行业影响

落地场景与产品价值

ARDY 的流式生成框架混合表征 让实时、可控的 3D 人体动作生成成为可能,直接面向如下产品化方向:

  • 交互式娱乐与虚拟人:在游戏、VR/AR 中,根据玩家文本指令或手柄输入实时驱动角色做出自然动作,替代预烘焙动画,大幅降低资源制作成本。
  • 人形机器人与数字孪生仿真:工业仿真中,通过在线文本命令让虚拟人执行复杂长序列任务,支持实时路径跟随和关键位姿约束,用于自动驾驶中的人体行为预测或仓储机器人操作训练。
  • 内容创作工具:动画师通过自然语言描述和关键帧 pose 即时生成高质量动作片段,减少逐帧 K 帧工作量,赋能短视频、虚拟主播等 UGC 平台。
  • 运动训练与康复评估:输入治疗文本指令,实时生成标准示范动作并跟踪患者对比,提供视觉反馈。

商业价值

  • 降本增效:动画制作中,传统动作捕捉需专业影棚和演员,ARDY 可 10 倍以上降低单条动作生成成本,并将制作周期从天缩短至秒级。
  • 体验升级:在线游戏与虚拟社交中,实时文本驱动角色动作能极大提升沉浸感与用户粘性,带来付费转化潜力。
  • 模型即服务(MaaS):可封装为 API,为数字人厂商、游戏引擎、机器人仿真平台提供实时动作生成能力,按调用量或订阅收费,直接嵌入现有动画管线。

与现有工作流的接口

ARDY 提供的两阶段扩散模型天然适配流式推理,可部署为轻量级推理服务,通过 gRPC/WebSocket 接收文本 prompt 和约束参数,输出骨骼动画数据,无缝集成入:

现有工具 集成方式 价值
Unity/Unreal 引擎 通过插件封装 ARDY 客户端,替换 Animator 组件 动态响应玩家输入,无需预置动画状态机
ROS/Isaac Sim 发布文本/约束话题,订阅动作话题 人形机器人遥操作或仿真测试
Blender/Maya 动画软件 脚本或插件调用 ARDY API,生成骨架动作并绑定至模型 加速关键帧制作和动作原型设计

具体落地用例

  1. 电商虚拟主播:直播带货中,运营人员在后台输入“优雅展示手机,转身微笑”,ARDY 实时驱动虚拟人做出连贯动作,支持键位控制移动和手部关键帧微调。相比现有依赖手工编排或离线生成的方案,能即时响应商品变化和观众互动,降低直播间运营人力成本 50% 以上。
  2. 自动驾驶人因仿真:在感知算法测试中,平台通过 ARDY 实时生成行人过街、突然停顿等危险场景行为,结合速度、路径等空间约束,生成高真实感、可复现的长序列动作,替代昂贵且危险的实车数据采集,加快边缘场景覆盖率。

局限

  • **流式生成中的误差累积与延迟敏感**:ARDY 的自回归生成范式依赖于已生成的历史帧作为上下文,当测试时文本或运动学约束发生突变时,模型可能难以快速调整,导致一段不自然的过渡运动。同时,虽然声称实时性,但两阶段去噪器在每一帧都需要执行两步扩散推理,在实际交互场景中可能引入不可忽略的延迟,尤其在低算力设备上。论文未讨论最小延迟要求与失败案例,这限制了低延迟应用(如 VR/AR)的信任采纳。
  • **显式-潜混合表示的权衡**:ARDY 将运动分解为显式根轨迹与潜身体嵌入,这有利于长程路径跟随,但也带来隐式的身体姿态控制盲区。对于精细的全身关键帧约束(如手指姿态、脚部接触),潜空间可能无法精确表达,导致约束匹配度下降。此外,tokenizer 的训练是基于重建目标,并非直接优化约束遵循,因此生成的潜嵌入可能偏离真实数据分布,影响运动逼真度。在复杂约束组合下,这种表示的能力边界尚不清楚。
  • **训练数据依赖与泛化性**:ARDY 依赖大规模动作捕捉数据(Bones Rigplay)进行训练,虽然比现有基准更大,但数据仍局限于特定演员与动作类型。对于极端动作、非人形运动或风格化动作的泛化能力未做探索。同时,模型利用真实姿态中的运动学约束采样进行条件训练,在测试时若输入的约束分布与训练不匹配(例如不合理的轨迹速度),生成质量可能急剧下降,论文并未提供相关鲁棒性分析。
论文Kaifeng Zhao2026-07-09原文

相关内容