论文

MotionVLA: 面向人形运动的视觉-语言-动作模型

MotionVLA: 面向人形运动的视觉-语言-动作模型

从场景图像和文本生成逼真人形运动需要同时建模低频姿态语义和高频物理动力学。现有方法通常使用单一共享码本将运动量化为离散token,迫使异构信号进入同一语义空间,导致高频分量表征不足。频域分析表明,5个DCT系数可捕获 93% 的关节位置能量,但仅捕获 37% 的关节速度能量,使得量化偏向姿态统计,忽视高频动态。 为解决上述问题,本文提出 DSFT 双流频率分词器,将运动分解为 Base流(低频姿态)和 Physical流(高频物理),分别采用 DCT截断 和 BPE 独立压缩,避免频率信息混叠。在此基础上,构建基于 Qwen3.5 的 MotionVLA 模型,将 Base 与 Physical 两种 token 统一排列为序列,并采用自回归方式在 Base token 之后预测 Physical token,以适配高频信号的建模需求。 在 HumanML3D 和 MBench 上的实验表明,尽管仅使用轻量级 2B 骨干网络,MotionVLA 在 HumanML3D 上使生成运动与真实数据的多样性差距降低超过 50%,并在 MBench 上提高运动条件一致性 3.8%,验证了频率感知双流解耦对自回归运动生成的有效性。代码与项目主页已开源。

论文精读

TL;DR MotionVLA以双流频率tokenizer分离低频姿态与高频物理信号,基于Qwen3.5的2B模型显著缩小多样性差距并提升运动-条件一致性。

问题

问题背景

人形动作生成从场景图像与文本指令出发,在具身 AI、数字人动画和虚拟现实领域需求迫切。主流方案采用向量量化(VQ)将连续运动序列离散为词元,再交由自回归模型进行条件运动合成。

现有方法局限

大多数方法共用单码本量化 所有运动特征,忽略了人体运动显著的频率异质性:低频姿态(如关节位置)与高频物理量(如速度、加速度)能量分布差异极大。经 DCT 分析,5 个系数便容纳 93% 的位置能量,却仅保留 37% 的速度能量。这导致单码本训练 偏向低频成分,迫使高频物理信号被严重欠表示(under-representation)。同时,常规自回归模型天然更利捕捉低频平滑变化,难以有效预测高频残差,进一步放大物理细节失真,表现为多样性不足、动作僵硬或违反物理约束。

为什么这个问题难/重要

运动生成需兼顾语义正确(“做什么”)与物理真实(“如何动”),二者分别对应低频和高频分量。共用量化空间相当于一套码本同时处理“轮廓”与“纹理”,优化冲突使模型往往牺牲高频细节换取低频重建精度。在场景交互场景下,高频速度、力与接触动力学信息的缺失,直接导致穿透、滑步、失衡等不真实现象。对机器人仿真、遥操作和沉浸式交互应用而言,动作的物理可信度是必须跨越的门槛。显式解耦频率特性的表达与生成机制,已成为提升自回归运动生成质量的关键挑战。

行业类比

与音频编码中将信号拆分为低频主成分与高频细节带分别编码类似(子带编码),该工作通过频域解耦 为自回归模型注入结构化先验——就像 CLIP 将图文映射到对齐但分离的表示空间,使大语言模型更稳定地生成复杂输出。

核心洞察

  • 频率域分析揭示运动表征的根本冲突:低频频谱主导姿态重建,高频成分被单一码本欠表征,直接导致生成多样性不足。与现有单码本 VQ‑VAE 方法不同,DSFT 通过 DCT 截断将姿态(Base)与物理动态(Phys)分别独立压缩,让每个流专注于自身频段统计特性,从根源上解耦异构信号。这种设计使得 MotionVLA 在 HumanML3D 上将多样性 gap 减半,在 MBench 上提升运动条件一致性 3.8%,且仅需 2B 参数。
  • 双流频率 token 的统一序列建模策略:将 Base 与 Phys token 按“先基础后物理”顺序排列并自回归预测,显式编码了高低频的时间依赖关系。相比 MotionGPT 等将运动 token 无差别输入的做法,MotionVLA 的顺序设计更符合物理动态强依赖于静态姿态的先验,使模型高效捕获高频速度信息,避免了直接混合建模导致的频率间干扰与量化偏差,以轻量姿态实现了更真实的类人运动生成。

方法

方法核心流程:从场景到人形运动的双流解耦生成

1. 输入与表示

给定场景图像和文本动作描述,MotionVLA 需生成三维人形运动序列。传统的单一码本离散化难以同时捕捉运动的低频姿态(如关节位置)和高频物理动态(如关节速度),因此先通过频率分析定位问题:DCT 系数显示前5个系数可表达 93% 的位置能量,但仅 37% 的速度能量,表明单一码本极易丢失高频信息。

2. DSFT:双流频率域分词器

DSFT (Dual-Stream Frequency-domain Tokenizer) 将运动序列分为两个独立流:

  • Base 流:承载低频姿态语义。对关节位置序列进行 DCT 变换,截断保留极少量的主要系数(如5个),直接作为离散 token 的基础,大幅压缩数据。
  • Physical 流:承载高频物理动态。对速度信号采用 BPE(字节对编码)处理,在离散符号层面对高频变化进行合并与压缩,形成紧致的 token 序列。 两流完全独立编码,避免量化偏差。

3. MotionVLA 自回归生成模型

基于 Qwen3.5 多模态基座(仅 2B 参数),设计统一序列的自回归方案:

  • 序列组织:将 Base tokens 与 Physical tokens 拼接,规定 Base 先于 Physical 的顺序。
  • 预测流程:先根据图像和文本条件自回归生成全部 Base tokens;在此基础上,模型继续生成对应的 Physical tokens,使高频动态显式条件化于已生成的姿态流。
  • 训练策略:采用两阶段过程——冷启动阶段仅训练运动 token 的嵌入层,使其适应基座;后续使用 LoRA 高效微调基座的语言模型部分,冻结视觉编码器等。

4. 输出与解码

模型输出双流 token 后,Base tokens 经逆 DCT 还原关节位置,Physical tokens 解码为速度或关节旋转,最终合成具备自然动态的完整运动。

与同类工作的核心差异:区别于用单一码本同时表现姿态与物理的现有方法,MotionVLA 通过频率域分析显式解耦双流,使低频和高频分量各自以最合适的方式建模,从根本上缓解了高频物理信号在量化过程中的信息损失,从而在多样性与条件一致性上获得显著提升。

实验

实验在 HumanML3DMBench 两个数据集上进行,评估指标包括多样性差距(与真实数据相比)和运动-条件一致性。

实验设计

作者将提出的 MotionVLA(基于 Qwen3.5-2B)与采用单码本量化的自回归运动生成基线进行比较,旨在验证双流频率 tokenizer (DSFT) 分离低频姿态和高频物理动态的有效性。HumanML3D 测试文本到动作生成,MBench 则考察场景图像和文本条件控制下的动作生成质量。

关键发现

  • 尽管模型规模仅为 2B,MotionVLA 在 HumanML3D 上将多样性差距缩小了超过 50%,表明生成的动作多样性更接近真实数据分布。
  • MBench 上,运动-条件一致性提升 3.8%,说明双流设计更好地保留了条件信号(如场景和文本)与动作之间的对齐关系。
  • 频率域分析证实:单码本量化偏向于占能量主导的低频位置信号,而 DSFT 通过独立压缩高频速度信息,有效缓解了物理动态的表征不足问题。

与基线对比

现有方法普遍采用共享码本量化所有运动帧,导致高频物理成分被淹没。MotionVLA 通过分离 Base 和 Phys 流,并在自回归序列中让 Phys 令牌在 Base 令牌之后预测,实现了对运动序列中频率差异的显式建模。实验结果表明,这种频率感知的双流解耦大幅优于单码本基线,同时保持轻量高效,为基于自回归模型的动作生成提供了新的有效范式。

行业影响

落地场景

MotionVLA 的 scene-to-motion 能力可嵌入游戏引擎(如 Unity/Unreal),从场景截图和自然语言指令实时生成 NPC 或玩家角色的环境适应型运动(例如爬楼梯、跨越障碍),替代传统手工动画。在人形机器人领域,结合视觉感知的端到端运动生成可简化示教数据采集,直接为 MuJoCo 等仿真器提供物理合理的高频控制序列。此外,影视预演、虚拟主播、VR 社交应用也能受益于这种条件式运动合成,快速产生多样且物理一致的动作资产。

商业价值

核心降本点在于运动数据制作与复用。当前高品质动作捕捉成本高昂且难以覆盖开放场景;MotionVLA 的 2B 轻量 backbone 可部署在端侧或云端,以文本/图像提示快速产出运动序列,将运动设计时间从小时级压缩到秒级。同时,其双流频率分词器显著提升运动多样性(HumanML3D 上 Diversity 差距降低 50%),带来差异化的内容体验,有助于提升用户留存与交互粘性,在内容平台(如短视频创作工具)可直接转化为付费能力。

与现有产品/工作流的接口

模型输出是人体关键点序列或关节旋转角度,可通过标准化骨骼映射(如 HumanML3D 骨架)导入主流动画蓝图。推理时,输入为单帧 RGB 图像和动作描述文本,因此可直接对接视觉语言模型(VLM) 的输出,形成感知-规划-动作流水线。在机器人应用中,生成的运动可经过逆动力学转换驱动真实伺服电机;在仿真中,作者已提供 MuJoCo 部署管线。集成上,通过 ONNX 导出或模型服务化(如 Triton Inference Server)嵌入现有内容管线即可。

具体落地 use case

  • 电商虚拟模特:给定商品橱窗场景图和“模特走向沙发坐下”的指令,自动生成符合物理和场景遮挡的模特运动序列,代替预录制视频素材,降低拍摄成本且支持动态交互。
  • 自动驾驶仿真:交通场景中,根据路口图像和“行人过街”的文本提示,实时产出行人运动轨迹与姿态,用于感知算法测试时的多样本生成,提升 Corner Case 覆盖。

局限

  • **推理延迟可能限制实时应用**:虽然 MotionVLA 采用 2B 参数的 Qwen3.5 轻量骨架,但自回归生成方式仍需逐令牌预测运动序列,生成长序列时解码步数多,推理速度可能不及扩散模型或一次性回归方法。论文未提供推理延迟或吞吐量数据,在交互式或闭环控制场景中的实时性存疑,实际部署需额外优化。
  • **频率解耦超参数依赖人工设定**:DSFT 将运动分离为 Base 流(保留前 5 个 DCT 系数)和 Phys 流(使用 BPE 压缩高频分量),这一划分依赖于对特定数据集的频谱分析。当动作风格、关节配置或帧率变化时,能量分布可能漂移,预设的截断参数未必最优,缺乏自适应频率划分机制,跨数据集泛化需重新调参,增加了应用成本。
  • **缺乏显式物理约束,物理合理性未充分验证**:尽管 Phys 流旨在捕获高频物理信号,但模型训练仅依赖数据分布,未引入动力学方程或接触力约束,生成的运动会仍可能出现关节超限、脚底滑步或穿模现象。实验指标(FID、多样性差距、Motion-Condition Consistency)无法直接评估物理可行性,论文虽提及 MuJoCo 仿真与真机部署,但正文中未给出定量物理合理性指标,离实际机器人控制尚有距离。
论文Nonghai Zhang2026-06-13原文

相关内容