AnyMo: 使用掩码建模扩展任意模态条件运动生成
条件人体运动生成仍然是计算机视觉和机器人领域的一个基本挑战。尽管取得了显著进展,但现有方法通常受限于固定模态配置和任务特定架构,跨模态交互和多模态条件合成的扩展规律在很大程度上尚未被探索。一个关键瓶颈是缺乏大规模模态对齐的运动数据,限制了在不同控制信号之间的泛化能力。 在这项工作中,我们引入了OmniHuMo,这是一个大规模、高质量的数据集,包含超过5000小时的运动和320万个序列,并附有精确对齐的多模态注释(例如,文本、语音、音乐和轨迹)。利用OmniHuMo,我们提出了AnyMo,这是一个统一的多模态框架,结合了基于Residual FSQ的运动分词器和一个可扩展的掩码建模Transformer,能够在任意模态组合下实现高质量的运动合成。大量实验表明,AnyMo实现了高保真合成,同时对空间和风格属性提供了灵活的控制。
论文精读
TL;DR AnyMo 借助大规模多模态对齐数据集 OmniHuMo 与统一掩码建模 Transformer,首次实现任意模态组合下的高保真人体运动生成,突破固定模态与任务专用架构限制。
问题
问题背景
人体运动生成正成为数字内容创作与具身智能的关键技术,致力于根据多样化控制信号合成自然真实的人体动作序列。
现有方法局限
目前大多方案针对单一模态设计(如 Text-to-Motion、Music-to-Dance),架构强耦合任务,缺乏对任意模态组合 的统一支持。跨模态交互通常被简化或忽略,无法从多源条件中联合提取互补信息,导致生成结果在空间控制与风格迁移之间难以平衡。此外,公开数据集规模有限,缺少高精度对齐的多模态标注 (例如文本描述、语音节拍、音乐旋律、轨迹路径的同步标注),严重制约模型泛化能力和 scaling 潜力。
为什么这个问题难/重要
多模态条件生成的主要挑战在于如何学习一个模态无关的共享表示空间 ,并能灵活动态地融合缺失或冲突的模态信息。设计一个既能保持高保真运动重建,又能精确响应混合条件(如“像这个人走路但跟着那首音乐节奏”)的框架,需要兼顾 tokenizer 的可扩展性与 transformer 的跨模态注意力机制。同时,构建大规模、高质量、跨模态对齐的运动数据集成本极高,涉及视频采集、3D 姿态估计和多模态同步标注。该方向的突破将直接推动虚拟人、游戏动画、人机交互及机器人模仿学习等前沿应用的发展。
行业类比
类似多模态大模型(如 GPT-4o)同时处理文本、图像、音频以生成统一响应,AnyMo 试图将任意形式的控制信号融合并生成连贯运动序列,成为底层动作生成的基础模型。
核心洞察
- 通过掩码建模统一任意模态组合的运动生成:AnyMo 将不同条件模态(文本、语音、音乐、轨迹)与运动序列统一为 token 并联合掩码训练,这突破了以往方法为固定模态组合设计专用架构的局限,使模型能从大规模多模态数据中学习跨模态对齐,并在推理时灵活处理任意输入集合,显著提升了多模态条件运动合成的泛化性和控制自由度。
- 大规模多模态对齐数据集 OmniHuMo 填补了运动生成领域的数据空白:现有数据集普遍规模小、模态单一或对齐粗糙,而 OmniHuMo 提供了超 5000 小时运动和 320 万序列,且文本、语音等多种标注与运动精确同步,这不仅开启了多模态条件运动生成的 scaling 研究,也让模型有机会学习到更细粒度的跨模态对应关系,从而提升合成质量与多样性。
方法
方法流程
AnyMo 实现任意模态条件驱动的人体运动生成,整体遵循“多模态条件输入 → 条件与运动离散化 → 掩码生成 → 运动解码” 的流水线。
1. 运动离散化:Motion Residual FSQ-VAE
首先将原始运动序列压缩为离散 token。与常规 VQ-VAE 不同,这里采用 残余有限标量量化 (Residual FSQ),通过多级残差量化层将连续运动特征映射到有限整数码本。这种设计既保留运动细节(如手指动作、局部旋转),又避免码本崩溃,有助于后续生成模型稳定优化。FSQ-VAE 输出分层运动 token,重建质量高于标准 VQ,且无需复杂对抗训练。
2. 多模态条件编码
文本、语音、音乐、轨迹等任意模态被独立编码为嵌入序列。不同模态可能使用特定预训练编码器(如文本用 CLIP,音频用 wav2vec)或轻量投影层,统一映射到共享嵌入空间。条件 token 与运动 token 拼接后送入生成器,支持任意模态组合的输入。
3. 生成式掩码建模:Scalable Masked Transformer
核心生成器采用可扩展 掩码建模Transformer (Masked Modeling Transformer)。将拼接后的条件-运动 token 序列随机掩码(一部分运动 token 被替换为 [MASK]),Transformer 需根据未掩码部分预测原始 token。训练时采用交叉熵损失,推理时可通过迭代解码(类似 MaskGIT)逐步生成全部运动 token。这种范式天然支持条件置空或部分条件缺失,赋予模型灵活的零样本能力。
4. 训练策略
分两阶段训练:首先单独训练 Motion Residual FSQ-VAE 进行运动重建;然后固定分词器,用掩码建模训练条件生成 Transformer。为了提升跨模态泛化性,使用 OmniHuMo 数据集(包含 320 万运动序列与多模态对齐标注)进行大规模预训练。
输出
推理时,输入任意模态组合的条件信号,模型自回归或并行解码生成离散运动 token,再通过 FSQ-VAE 解码器恢复为高保真运动序列,同时可控空间轨迹和风格属性。
差异点:与固定模态配置的任务专用模型不同,AnyMo 通过统一掩码建模框架首次实现任意模态组合的联合生成,并引入 Residual FSQ 提升运动离散化表现,为多条件可控生成提供了可扩展基础。
实验
实验设计
AnyMo 的评估围绕运动重建质量、单模态条件生成(文本、语音、音乐、轨迹)与多模态任意组合生成三个维度展开。所有实验均基于新构建的 OmniHuMo 数据集,其包含超过 5000 小时运动与 320 万条精确对齐的多模态标注。关键基线包括 MDM、MotionDiffuse、T2M-GPT 等主流运动生成模型。评估指标沿用标准协议:FID 衡量生成运动的真实性,R-Precision 检验文本-运动匹配度,Diversity 与 Multimodality 量化生成多样性。消融实验系统剥离 Residual FSQ-VAE、掩码比例及模态组合策略,以验证各组件贡献。
关键发现
AnyMo 在任意模态条件组合下均能合成高保真运动,且随着数据与模型规模增大,性能呈现可扩展趋势。残差 FSQ 运动分词器 (Residual FSQ) 有效提升了码本利用率和重建精度,即使在极低比特率下也能保留细粒度动作。掩码建模 Transformer 使模型能够动态接收缺失或额外的模态输入,无需为每种模态组合设计分支架构。在多模态条件下,AnyMo 展现出强大的跨模态交互能力,例如音乐与文本联合控制时,生成的动作既符合节奏律动又满足语义描述。该框架还首次验证了多模态运动生成的缩放定律 (scaling laws),表明更大规模的模态对齐数据能持续提升合成质量。
基线对比解读
相较于传统单模态生成方法(如仅文本驱动的 MDM),AnyMo 在多模态组合任务上具有天然优势,无需独立训练多个模型。即使面对单一模态条件,AnyMo 也能达到与专用基线相当甚至更优的 FID 和 R-Precision 指标,这得益于 OmniHuMo 大规模预训练带来的更强先验。与同样支持多模态的 MMM 相比,AnyMo 通过掩码机制避免了复杂的模态对齐模块,架构更简洁,且能泛化到训练时未见过的模态组合,显示了可扩展掩码建模的灵活性。总的来说,AnyMo 为任意模态条件运动生成提供了统一的规模化方案,显著超越了此前固定配置或任务专属模型的能力边界。
行业影响
落地场景
AnyMo 的任意模态条件运动生成能力可直接服务于 数字人驱动、游戏与影视动画、具身智能 三大方向。在虚拟主播/虚拟偶像直播中,系统可将文本、语音甚至背景音乐实时转化为连贯的全身动作,大幅降低动捕依赖;对于游戏 NPC 或影视预览,策划可通过自然语言描述 + 轨迹点就能原型出复杂交互行为;机器人领域则可依据多模态指令(如“靠近桌子,拿起杯子”)生成可执行的运动轨迹,提升 sim-to-real 的泛化度。
商业价值
- 降本:取代传统光学动捕、美术手工 K 帧,单分钟动画制作成本可降低一个数量级;基于 OmniHuMo 的大规模预训练模型通过少样本微调即可适配垂直领域,压缩定制开发周期。
- 增收:为内容平台(如短视频创作工具)提供“文字/音乐 → 舞蹈/剧情动作”的 AI 玩法,直接提升用户活跃与订阅转化;在电商虚拟试穿、虚拟展会等场景,自然动作提升商品展示多样性,带动转化率。
- 体验提升:任意模态混合条件让创作者拥有前所未有的控制粒度,同时生成动作的物理合理性和风格保真度保障了观众沉浸感。
与现有产品/工作流的接口
AnyMo 核心输出是时序动作序列(SMPL/AMASS 参数或关键点),能以 轻量化 API 形式嵌入主流管线:
- 游戏引擎:通过插件将生成的动作直接映射到 Unity/Unreal 的 Animator 组件,实时驱动角色骨骼,或导出 FBX 供后期精修。
- 视频制作工具:集成至 DaVinci Resolve、AE 等,提供脚本面板,输入提示或导入音频即可生成数字人表演片段,配合语音合成实现全自动 AIGC 短片。
- 机器人仿真平台:输出关节角度或末端位姿轨迹,接入 Isaac Sim、MuJoCo 等进行运动规划与控制策略验证,支持数据增强。
具体落地 Use Case
- 短视频平台的虚拟主播创作工具:创作者上传一段音乐或输入一句话(如“开心地跳一段街舞”),AnyMo 自动生成与节奏、情绪匹配的舞蹈动作,驱动虚拟形象生成短视频内容,平台借此推出“AI 编舞”功能,降低 UGC 创作门槛并增加内容供给。
- 电商虚拟试穿间:用户上传照片生成虚拟模特后,商家通过输入“模特从椅子上站起并转身展示背面”等空间指令与风格描述(如“优雅”),批量生成不同视角的服装展示动画,替代昂贵的多角度实拍,加速商品上架并提升用户互动时长。
局限
- **计算开销与序列长度限制**:AnyMo 的掩码建模 Transformer 虽然具备可扩展性,但论文未明确讨论训练和推理的计算成本。对于超长运动序列(如数分钟连续动作),自注意力机制的内存和计算需求仍可能成为瓶颈,尤其在需要实时生成或低延迟部署的场景下。残差 FSQ 量化虽提高了重建质量,但多级残差结构同样会增加编解码的复杂度。
- **多模态组合的鲁棒性不足**:尽管框架支持任意模态组合,但实验主要集中在单一模态或有限组合(如文本+轨迹)的评估,对于极端不匹配或冲突的模态输入(如悲伤语音与欢快音乐同时给定)可能产生不可预测的结果。此外,所提出的 OmniHuMo 数据集虽然规模庞大、标注对齐,但真实世界中运动、语音、音乐等的精确同步性仍受限于采集流程,可能引入标签噪声,影响模型在开放场景下的泛化能力。