论文

Motion4Motion: 推理时的跨主体运动迁移

Motion4Motion: 推理时的跨主体运动迁移

本文探索了从一个视频到另一个视频的运动迁移,该技术在动画制作中对于多样化的角色至关重要。以往,视频运动迁移主要研究人类与类人角色之间,推动了数字创作的诸多应用。然而,这些方法存在一个主要限制:相关技术流程严重依赖预定义的人体骨骼结构,并要求基于骨骼条件进行模型训练。一方面,这些方法难以泛化到不同物种的动物等多样角色,同时保留其独特的运动风格;另一方面,不同骨骼的标注数据有限,进一步限制了该任务的大规模训练。 为此,本文跳出基于骨骼的运动迁移框架,提出了一种无需训练的运动迁移框架——Motion4Motion。与骨架不同,Motion4Motion 对视频中角色的运动流进行建模,使得跨物种的运动迁移更加容易。大量实验结果和新颖应用表明,我们的方法在性能上显著优于基线方法。项目页面:https://lhchen.top/Motion4Motion。

论文精读

TL;DR Motion4Motion 舍弃骨架驱动范式,通过运动流建模实现训练无关的跨物种动作迁移,极大降低对标注数据的依赖并提升泛化能力。

问题

问题背景

视频动作迁移旨在将源视频中的运动模式 迁移至目标角色,在数字人驱动、影视后期和虚拟现实等应用中需求强烈。当前主流方法聚焦人体,基于骨架表示实现几何对齐。

现有方法局限

现有基于骨架的方法依赖预定义的人体骨架结构,训练时需注入骨骼关键点作为条件。这带来明显局限:

  • 跨物种泛化困难:不同物种(如四足动物)的骨架拓扑与人体差异大,强行适配会破坏目标角色的特有运动风格;
  • 标注数据稀缺:大规模标注不同骨架的运动数据成本极高,限制了模型扩展到广义角色的能力;
  • 训练耦合:通常需要针对特定骨架进行端到端训练,无法即插即用,导致工业化部署灵活度不足。

为什么这个问题重要且困难

核心挑战在于无成对数据 下解耦运动与外观,同时保持时序一致性。跨物种迁移时,源与目标的形态拓扑差异远超同物种内部,简单的几何变形会丢失精细运动细节。业界对减少动画制作成本、实现“一次训练,任意驱动”的需求愈发迫切,训练无关(training-free)且骨架无关的方案因此具有高工程价值。

行业类比

类似语音合成中的声音克隆,无需说话人的文本-音频对齐,仅凭少量语音片段即可复刻音色。动作迁移若能摆脱特定骨架模板,将实现类似的“动作克隆”灵活性,使任意视频素材都可直接驱动虚拟角色。

核心洞察

  • 从基于骨架到基于运动流的范式转换:Motion4Motion 完全跳出传统预定义人体骨架的框架,直接在视频表征中建模运动流 (motion flow)。这使得运动迁移不再局限于类人角色,能够轻易泛化到不同物种,同时保留各自的运动风格。与依赖骨骼标注和骨骼条件模型训练的方法相比,它从根本上规避了数据稀缺和结构固化的限制。
  • 无需训练 (training-free) 的即时运动迁移:该框架基于预训练 Diffusion Transformer,利用跨帧注意力对应 (cross-image correspondence) 提取和传递运动信息,不需要任何针对性微调。这避开了为每个新角色骨架收集大量标注数据并重新训练的繁复流程,为动画制作中的快速原型开发和大规模多样化角色应用提供了高效途径。

方法

方法概览

Motion4Motion 提出一种无需训练的 video motion transfer 框架,核心思路是摆脱对预定义骨骼结构的依赖,直接在像素空间建模角色的 运动流 (motion flow),实现跨物种、跨角色的运动迁移。输入为一对视频:源视频提供运动模式,目标视频提供外观身份;输出为合成视频,其中目标角色复现了源视频的运动,同时保持自身外观特征。

关键模块

  1. 运动流建模

    • 基于视频扩散模型(如 CogVideoX)的自注意力层提取跨帧对应关系。
    • 将源视频中相邻帧之间的位移向量组成为 motion flow,该 flow 是密集的像素级映射,不依赖任何关键点或骨架标注。
    • 利用 cross-image correspondence 技术,在目标视频帧之间建立相同的对应关系,从而将源运动流迁移至目标角色。
  2. TransPE (Transfer Positional Encoding)

    • 在扩散模型的自注意力层中注入运动流信息,通过修改位置编码来引导注意力分布。
    • 具体而言,对于目标视频的每一帧,根据运动流计算其应该参考的源帧位置,并在自注意力计算时调整 key/value 的来源帧索引,从而将源帧的运动特征融入目标帧生成。
    • 此过程为 attention manipulation,无需额外训练或微调,完全在推理时完成。
  3. 初始化与真实视频处理

    • 对于真实视频输入,先用扩散模型的反演 (inversion) 技术获得初始噪声,再结合运动流进行可控生成,避免了对成对标注数据的依赖。

与同类方法的差异

相较于传统 skeleton-based 方法(如基于 OpenPose 或 SMPL 的管线),Motion4Motion 不需要预定义骨架结构,因此可以无缝迁移到任意角色(动物、虚构生物等),突破了“类人”限制,且完全训练自由,仅利用预训练视频扩散模型的能力。

实验

实验设计概述

本文提出 Motion4Motion,一种免训练的基于运动流(motion flow)的运动迁移框架,旨在突破传统骨骼限制,实现跨物种角色运动迁移。实验设计围绕以下几个方面:

  • 跨物种视频数据:涵盖人类与多种动物(如猫、狗)的运动视频,但具体数据集未在摘要中列出。
  • 对比基线:与基于骨骼的主流算法对比,虽然未具名,但可推断包含 skeleton-based motion transfer 等典型方法。
  • 评估协议:采用定量指标(运动一致性、外观保真度)、定性可视化及用户调研,系统验证性能。

关键发现

  • 泛化性强Motion4Motion 不依赖预定义骨架,直接建模角色的运动流,使迁移不受骨骼结构限制,能无缝处理人、动物乃至非生命物体。
  • 免训练推理:无需针对特定骨架标注数据重新训练,避免了数据稀缺问题,显著提升了实际部署的灵活性。
  • 效果领先:实验表明,该方法在保持目标外观的同时,准确迁移源运动风格,且支持新奇应用(如“教桌子走路”)。

与基线对比解读

传统骨架方法依赖精确的姿态估计和骨架模板,与骨架不匹配的目标(如非人形生物)会导致迁移失败或严重失真。Motion4Motion 通过构建目标运动流并借助 TransPE 注意力操控,在特征空间直接融合运动模式,不引入任何显式结构先验。因此,在动物甚至无生命物体上,仍能保持运动风格的自然传递,而基线方法往往产生畸变。这一范式转换凸显了运动表示从“骨架”向“流”演进的重要性,为泛化运动迁移简化了动画流程。

行业影响

落地场景

Motion4Motion 作为一种无需训练、不依赖骨骼的动作迁移框架,可广泛应用于角色动画、影视后期、虚拟主播与游戏开发等产品管线。它允许直接将一段视频中的运动模式迁移到另一段视频中的任意角色上,甚至跨物种(如动物、拟人化物体),这为内容创作平台提供了快速生成多样化动画的能力。

电商直播 中,虚拟数字人驱动需要为不同外观的 3D 或 2D 形象生成自然动作。利用 Motion4Motion,只需一段真人主播的动作视频,即可实时驱动各种风格的虚拟主播,无需为每个新角色重新训练骨骼模型,大幅缩短上线周期。

影视后期与广告制作 中,常有将真实动物、机械角色或奇幻生物的表演与真人动作融合的需求。传统骨骼绑定对非人角色适配性差,而 Motion4Motion 通过视频动作流 (motion flow) 直接迁移动态信息,避免了复杂的绑定和蒙皮流程,让视效团队能更快迭代创意。

商业价值

  • 降本:免去骨骼标注与条件模型训练的环节,尤其对于多物种、多风格角色库,省去了为每种骨架单独收集数据、训练模型的成本。
  • 增效:训练自由 (training-free) 的推理特性支持“即插即用”,美术人员可在现有视频素材上直接应用,无需等待训练周期,加速内容产出。
  • 体验提升:能够保留源运动中独特的动态风格,同时保持目标角色的外观一致性,避免骨架映射带来的僵硬感,提升动画自然度和观看体验。

与现有产品/工作流的接口

Motion4Motion 基于 扩散 Transformer (DiT) 的视频生成架构,并利用交叉帧注意力操控 (TransPE) 来实现动作流注入。这使其能够与现有的视频生成模型(如 Sora、Video Diffusion 系列)或图像生成模型的工作流无缝对接。集成方式通常为:

  1. 使用预训练视频生成模型作为基础,冻结其权重;
  2. 在注意力层插入 TransPE 操控模块,根据源视频帧间的运动流修改目标视频生成时的注意力分布;
  3. 提供源视频和目标角色图像/视频作为外部条件输入,输出动作迁移后的视频。

这一设计意味着,任何已部署的扩散范式的视频生成服务,都可以通过少量的代码级修改(添加注意力操控层)获得动作迁移能力,无需重新训练基础模型或调整完整推理管线。对于已有视频编辑 API内容生成中台的团队,可将 Motion4Motion 封装为独立微服务,通过传入一组(源视频、目标角色素材)即可获得迁移结果,融入自动化创作流水线。

局限

  • **依赖视频生成模型质量**: Motion4Motion 基于预训练的 DiT 视频生成模型,其性能受限于该模型的底层能力。若生成模型对复杂背景、快速运动或细粒度纹理处理不佳,运动迁移效果会明显退化。此外,无需训练虽降低了数据门槛,但无法针对特定领域微调,可能在专业应用(如高精度影视动画)中不及有监督方法。
  • **运动流建模的局限性**: 该方法假设运动流主要由跨帧对应关系描述,但当目标主体与源主体在几何结构差异过大(例如从四足动物到六足动物)时,构造的 Target Motion Flow 可能失效,导致形变不自然或关节错位。论文未系统评估极端形态差异(如昆虫、鱼类)下的表现,实际工程中需注意边界情况。
  • **评估泛化性有限**: 实验主要在合成视频或标准数据集上进行,缺乏大规模、多物种的真实视频评估。虽然展示了“Teaching a Table Walking”等创意应用,但此类案例更多是概念验证,未量化衡量在真实拍摄视频中运动迁移的鲁棒性,可能高估实用性。
论文Ling-Hao Chen2026-07-13原文

相关内容