论文

面向现实世界运动语言模型的即插即用2D运动接口

面向现实世界运动语言模型的即插即用2D运动接口

运动语言模型(Motion Language Models, MoLMs)通常通过3D运动标记化,再利用语言模型处理所得标记来理解人类动作。然而,从单目视频中获取准确的3D运动十分困难,这限制了其在现实世界中的应用。 为此,我们提出一种即插即用的2D运动接口(2D Motion Interface),使经过3D预训练的MoLMs无需修改或微调即可直接接受2D运动输入。在公共数据集上的实验表明,该方法在多个MoLMs上取得了与3D运动输入相当的性能,并且优于从零开始基于2D运动训练的MoLMs。我们进一步构建了单目真实世界视频运动评估数据集,并引入真实视频适配器,证明了在单目姿态估计场景下,2D运动比3D运动更具实用性。 这些结果表明,2D运动为在现实世界运动理解任务中部署MoLMs提供了一种实用的接口。代码已开源:https://github.com/irajisamurai/2D-Motion-Interface。

论文精读

TL;DR 提出即插即用的 2D 动作接口,让 3D 预训练动作语言模型无需微调即可处理单目 2D 输入,性能与 3D 相当,并配套真实视频适配器验证实用性。

问题

问题背景
动作语言模型(MoLMs)借助 LLM 处理 token 化的 3D 运动,实现动作描述、问答等任务,成为人类运动理解的重要方向。

现有方法局限

  • MoLMs 依赖 3D 运动 token 化,要求输入为准确 3D 骨架序列;单目视频估计 3D 姿态存在深度歧义、遮挡与误差累积,真实场景下精度不足,会直接破坏下游语言理解性能。
  • 3D 运动数据采集依赖动作捕捉或受控环境,成本高且覆盖有限;现有 MoLM 的 tokenizer 与嵌入空间专为 3D 设计,无法直接接受 2D 输入。
  • 从零训练 2D MoLM 会丢失 3D 预训练知识,且需要大量 2D-文本对齐数据,工程代价高。

为什么难/重要

  • 需要设计即插即用接口,在不修改或微调原模型的前提下,将 2D 运动映射到 3D 预训练语义空间,保持 cross-modal alignment 与泛化能力。
  • 单目视频是真实世界最常见输入,2D 运动更稳定易得,解决该问题能显著降低 MoLM 部署门槛。
  • 类似即插即用 adapter 的方法已在 NLP/CV 中验证了保留预训练模型能力的同时适配新模态的价值。

行业类比
类似 CLIP 零样本能力被各种 adapter 复用,无需重新训练即可适配下游视觉任务,这里用 2D 接口适配 3D 预训练 MoLM,实现低成本真实视频理解。

核心洞察

  • 以 3D-pretrained MoLM 的 token 空间为对齐目标,实现 2D 到 3D 的跨维度迁移。现有 MoLM 依赖 3D 骨骼数据,限制了单目视频等真实场景的可用性;本工作冻结原 3D MoLM,仅训练轻量 2D motion encoder 将 2D 姿态序列映射到其码本空间,保留了模型对 3D motion 的先验知识,同时避免从零训练 2D MoLM 的高成本和性能下降。这种 plug-and-play 设计让已有 3D MoLM 资产可直接复用于 2D 输入,工程落地门槛低。
  • View Randomization(视角随机化)是一种低成本、高收益的 2D 数据增强策略,模拟 3D 视角投影的不确定性。2D 骨架高度依赖相机视角,模型需要学习视角不变性;训练时随机旋转 3D 骨架再投影生成不同 2D 视图,迫使 encoder 将同一动作的多个视角映射到一致的 token 表示,从而提升对未知视角的鲁棒性。相比多视角融合或显式 3D 提升等复杂方案,仅通过合成随机投影即可达到接近 3D 输入的性能,显著简化了训练管线。
  • real-video adapter 专门处理真实单目视频中 2D 姿态估计的噪声与缺失,证明 2D 接口比估计 3D 更适合真实场景部署。单目视频直接估计 3D 骨骼误差通常较大,而 2D 关节位置相对可靠;adapter 在预训练 encoder 前对输入进行去噪和适配,在自建真实视频数据集上取得更好结果。该工作还补充了 MoLM 在真实视频评估上的空白数据集,为后续研究提供了基准。

方法

输入与预处理

系统接受单目 RGB 视频或2D 人体关键点序列作为输入。针对真实视频,先用现成的 2D 姿态估计器提取骨架关键点,再通过 real-video adapter 进行去噪与规范化,抑制估计误差对后续编码的影响。

关键模块:2D Motion Encoder 与视角随机化

核心组件是 2D motion encoder,它将 2D 关键点序列映射到预训练 3D MoLM 所需的 token 空间。训练时引入 view randomization(视角随机化),对 2D 姿态施加随机相机视角变换,迫使编码器学习视角不变的特征,从而弥补 2D 信息缺失深度维度的问题。该编码器通过跨模态对齐损失(如对比学习或与 3D VQ-VAE 的码本对齐)进行训练,使其输出 token 与 3D 运动 token 在语义上一致。

即插即用推理

推理时,2D encoder 生成的 token 直接替换原 3D MoLM 输入层中的 3D 运动 token,而 MoLM 的语言模型主体完全冻结,不参与任何微调。这意味着同一个 2D 接口可服务于多个不同的 3D 预训练 MoLM,无需针对每个模型单独适配。

输出与差异点

最终 MoLM 照常生成文本(如动作描述、指令理解等),保持原有 3D 预训练的语言能力。与需要精确 3D 姿态估计或从头训练 2D MoLM 的做法不同,本方法通过即插即用的离散 token 对齐,在不修改原始模型的前提下直接消费 2D 运动,显著降低了真实场景部署门槛。

实验

实验设计

  • 在多个公开 3D 动作数据集上评估多种 Motion Language Models (MoLMs),对比三种输入条件:原生 3D 动作、从零训练的 2D MoLM、以及本文提出的 2D Motion Interface(即插即用,不修改原模型)。
  • 构建 单目真实视频运动评估数据集,并引入 real-video adapter 来降低单目姿态估计噪声,对比 2D 与 3D 估计输入的实用性。

关键发现

  • 2D Motion Interface 在多个 MoLMs 上取得与 3D 输入 相当 的性能,证明无需依赖高精度 3D 重建即可理解动作。
  • 相较于从头训练 2D MoLM,该方法 显著优于,展示出对现有 3D 预训练模型的有效复用。
  • 在单目真实视频场景下,2D 动作输入在评估指标上 优于 3D 估计输入,凸显 2D 在噪声可控性上的优势。

与基线对比解读

  • 该方法的核心差异在于 完全无需微调 原始 MoLM,通过插入一个 2D 编码器实现跨模态对齐,降低了部署成本。
  • 真实视频适配器进一步弥补了 2D 输入与模型训练分布的差距,为实际应用提供了可操作的路径。工程上,这种插拔式设计允许快速切换不同 MoLM 或 2D 姿态提取器,适合快速原型验证。

行业影响

落地场景

该接口让预训练 MoLMs 直接消费单目 RGB 视频提取的 2D 关键点序列,无需 3D 传感器或多视角标定。典型应用包括:

  • 电商直播:实时分析主播肢体动作,用于商品展示交互、违规动作审核。
  • 在线健身与康复:利用普通手机摄像头捕捉 2D 姿态,调用 MoLM 生成动作反馈或纠正建议。
  • 智能监控:在边缘设备上做异常行为识别,避免部署昂贵 3D 深度相机。
  • 自动驾驶:从车载单目摄像头估计行人 2D 运动,辅助意图预测与风险评估。

商业价值

  • 降本:省去 3D 动作捕捉设备或精确 3D 姿态标注,显著降低数据获取与推理成本。
  • 增收:为现有视频分析产品提供新功能模块,如运动理解、动作摘要,提升付费意愿。
  • 体验提升:在移动端或 Web 端提供实时、低延迟的动作交互,增强用户粘性。

集成方式

该工作提供 plug-and-play 接口,可无缝插入现有 MoLM 或 LLM 推理流程:

  1. 替换原 3D 姿态估计模块为轻量 2D 关键点提取器(如 MediaPipe 或 OpenPose)。
  2. 加载预训练的 2D Motion Encoder,将 2D 关键点序列映射为与原 MoLM 一致的 token。
  3. 将 token 直接传入冻结的 MoLM,无需重新训练或微调。
  4. 在真实视频噪声较大时,可选用 real-video adapter 进行降噪后再编码。

论文代码已开源:GitHub

局限

  • **依赖 2D 姿态估计质量**:本方法的核心输入是单目视频提取的 2D 关键点序列,但其性能上限受限于 2D 姿态估计的准确性。论文在真实视频实验中引入了额外的噪声抑制步骤(real-video adapter 及噪声减少模块),这侧面反映原始 2D 输入可能不够鲁棒。对于遮挡、快速运动、多人交互等复杂场景,关键点提取误差会传播到下游 MoLM,导致理解性能下降。与直接使用 3D 姿态估计的方法相比,本方法虽然在估计难度上更低,但并未完全消除姿态估计误差的影响,且额外 adapter 的训练成本与泛化性需要进一步验证。
  • **存在信息损失与任务边界**:2D 动作表示丢弃了深度、三维空间关系及自遮挡信息,对于需要精确几何推理的任务(如动作质量评估、接触交互分析、空间导航等)可能无法完全替代 3D 输入。论文在公开数据集上的 comparable 性能多基于语义理解类 benchmark,而这些基准可能并未充分考察三维几何敏感的能力。未来可考虑混合 2D/3D 表示或引入可选的深度先验来缓解信息损失。
  • **即插即用性的实际边界**:论文声称无需修改或微调原始 MoLM,但需额外训练 2D motion encoder(E_2D)和 real-video adapter,且这些组件需针对不同 MoLM 的 token 空间进行对齐。对于下游用户而言是即插即用,但若想扩展至新的 MoLM,仍需重新训练或适配 encoder。此外,推理时的实时性、计算开销以及长视频流处理中的延迟问题均未深入讨论,限制其在边缘设备上的部署潜力。
论文Kaname Yokoyama2026-08-17原文

相关内容