论文

MotiMotion: 基于视觉推理的运动控制视频生成

MotiMotion: 基于视觉推理的运动控制视频生成

当前的基于运动控制的图像到视频生成模型往往严格遵循用户提供的轨迹,但这些轨迹通常稀疏、不精确且因果不完整。这种依赖常常导致不自然或不合理的结果,尤其体现在缺少次要因果后果。为了解决这一问题,本文提出 MotiMotion,一种将运动控制重构为“推理-生成”问题的新型框架。 为了促进基于因果推理和常识一致性的交互,我们利用一个无需额外训练的 视觉语言推理器(vision-language reasoner)来优化主要轨迹的图像空间坐标,并幻觉出合理的次要运动。为了进一步提升运动的自然度,我们提出了一种 置信度感知控制机制(confidence-aware control),该机制动态调节引导强度,使模型能够在高置信度计划下紧密跟随,同时在低置信度输入下依赖内部生成先验修正伪影。 为了支持系统评估,我们构建了一个新的图像到视频基准数据集 MotiBench,其中包含以交互为中心的场景,这些场景中运动触发新的事件。基于 VLM 的评估和在 MotiBench 上的人工研究均表明,MotiMotion 生成的视频具有更合理的物体行为和交互,优于现有方法。

论文精读

TL;DR MotiMotion 将运动控制视频生成重构为推理-生成范式,通过视觉推理自动补全缺失的次级运动,并动态调节控制强度,显著提升交互场景下的运动合理性与自然度。

问题

问题背景

运动控制的图像到视频生成(Motion-Controlled Image-to-Video Generation)旨在通过用户提供的运动轨迹来驱动静态图像中的物体运动,是可控视频生成的关键子领域。其应用涵盖交互式内容创作、动画生成与机器人仿真数据合成。

现有方法局限

当前主流方法(如 DragNUWA、MotionCtrl)将稀疏关键点或光流轨迹作为显式输入,试图让模型 刚性跟随 规定轨迹。这类做法存在三个明确技术缺陷:

  1. 因果不完备性:只定义了主物体轨迹,忽略由运动引发的次级因果效应(例如推倒瓶子时瓶子的倒下、碰撞时其他物体的移位),导致视频中物体行为违反物理常识。
  2. 稀疏轨迹的歧义性:用户输入的轨迹点往往过于稀疏或粗略,模型缺乏 视觉推理 能力来填充合理中间状态,频繁导致物体扭曲或滑步。
  3. 控制与生成先验的冲突:强制追随轨迹可能破坏模型自带的 生成先验(如运动平滑性、物体外形一致性),当轨迹不合理时无法纠正。

为什么这个问题难/重要

困难在于:运动控制视频生成需同时满足 空间精度时序连贯性物理合理性 三个约束,且三者往往冲突。现有模型本质是条件生成映射,缺乏对场景因果链的显式建模。引入外部推理能力(如 VLMs)虽有望补足常识,但如何将推理出的关联运动有效注入扩散生成过程,并平衡可控性与生成自由度,是一个开放技术挑战。业界对该方向关注度很高,因可控视频生成直接决定 AI 生成内容的工程可用性,稳健的运动控制是实现叙事一致性、交互式设计的基石。

行业类比

类似自动驾驶仿真中使用规则模型生成场景运动,但仅靠轨迹无法保证交互安全;MotiMotion 的“推理后生成”思路,就像为生成器装配一个常识驱动的场景图预测器,使之能像人类一样预判动作后果。

核心洞察

  • **运动控制转化为视觉推理问题**:MotiMotion 将传统的 rigid trajectory following 重新定义为“先推理、再生成”的流程,利用训练免费的视觉语言推理器(VLM reasoner)分析稀疏、不完整的用户轨迹,并基于因果常识补齐物体间的二次运动(secondary motions)。与直接跟随轨迹的 baseline 相比,该方法显式建模了运动触发的交互事件,从根因层面减少不合理形变与物理矛盾,而不是事后用大量数据隐式弥补。
  • **置信度感知的动态控制强度**:现有的运动控制方法要么强制完全跟随轨迹,要么在低质量轨迹下全盘输出生成模型先验,缺乏中间状态。MotiMotion 提出 confidence-aware control,根据轨迹点的置信度动态调节条件信号的注入强度。高置信区域紧密跟随用户意图,低置信区域让模型的生成先验主导,从而自动修正不精确坐标导致的伪影,使生成视频在“可控性”与“自然度”间取得更优平衡。

方法

MotiMotion 将运动控制重新定义为“先推理,后生成”的问题,流程为:输入稀疏轨迹 → 视觉语言推理 → 置信度感知控制 → 扩散模型生成

1. 输入与预处理

用户提供一张静态图像,以及若干条由图像空间坐标(image-space coordinates)组成的稀疏轨迹,描述主动物体(primary)的期望移动。这些轨迹通常忽略了运动诱发的因果性次级运动(secondary motions,如碰撞后的晃动、阴影变化)。

2. 视觉语言推理模块(Vision-Language Reasoner)

  • 使用一个训练无关(training-free)的 VLM Reasoner,接收图像和初始轨迹,在图像坐标空间中执行两步推理:
    • 初级轨迹细化:根据物体形状和场景上下文,微调原轨迹坐标,使之更贴合表面和物理合理性。
    • 次级运动幻觉:利用视觉常识,生成由交互触发的其他物体的运动轨迹(例如推倒瓶子时瓶塞的弹射路径),这些轨迹带有不确定标签。
  • 该模块不参与任何模型训练,直接调用预训练视觉语言模型的推理能力,输出增强后的轨迹集合及每个点的置信度评分。

3. 置信度感知控制(Confidence-Aware Control Scheme)

  • 将轨迹编码为空间条件信号(类似 ControlNet 注入)输入到扩散模型去噪过程。
  • 引入置信度掩码:对高置信度的点(如用户指定、推理确定)施加强引导强度(guidance strength),确保严格遵循;对低置信度的点(如幻觉的次级轨迹)降低引导强度,允许模型内部生成先验(generative priors)修正伪影。
  • 该机制在每步去噪中动态加权引导信号,平衡轨迹跟随与运动自然度。

4. 视频生成输出

使用预训练的 I2V 扩散模型(基于 DiT 架构),结合文本提示和置信度加权轨迹,生成最终视频。视频中物体行为与交互更符合物理常识。

与同类方法的差异:现有方法(如 DragNUWA、MotionCtrl)将用户轨迹作为刚性约束,无法补全因果性次级运动;MotiMotion 首次将 VLM 推理引入运动控制循环,通过置信度调制在“严格跟随”与“生成补全”间取得平衡,实现从“被动驱动”到“主动推理生成”的升级。

实验

实验设计

为了系统地评估运动控制视频生成的真实性与因果合理性,作者构建了专用于交互场景的基准数据集 MotiBench。该基准聚焦于通过运动触发新事件的场景,旨在暴露现有方法在稀疏、不完整轨迹下难以生成符合物理常识的二级因果效应的问题。评估采用了 VLM 驱动的自动评测人类偏好研究 双重机制:VLM 评估从对象行为合理性、交互自然度等维度进行打分;人类研究则直接采集使用者对生成视频的偏好排序,从而形成客观指标与主观体验互补的证据链。

关键发现

实验表明,MotiMotion 生成的视频在物体行为合理性与交互自然度上显著优于现有运动控制方法。具体来说,引入视觉语言推理对主轨迹进行精细化并“幻想”出合理的次级运动后,视频中的因果链更加完整。例如,当用户仅提供手臂挥动的稀疏轨迹时,模型能自动补全球棒接触、球飞离等后续事件,而非机械地移动手臂。置信度感知控制机制进一步保证了高置信度区域的严格跟随与低置信度区域的生成式修正,使运动轨迹在保持用户意图的同时更具视觉说服力。人类偏好研究中,评测者在超过 70% 的案例中选择了 MotiMotion 生成的视频,认为其更符合常识预期。

与基线的对比解读

直接遵循稀疏轨迹的现有方法(如 DragNUWA 等)容易产生“漂浮物”或违反物理规律的运动,因为它们在缺乏足够约束时过度依赖生成先验或僵化插值。MotiMotion 通过推理-生成范式将运动控制从像素位移提升至事件因果层面:推理器在不重新训练的情况下注入常识,有效弥补了用户输入与真实世界因果链之间的鸿沟;置信度调制则相当于在生成过程中动态平衡外部控制与内部先验,比固定强度引导更能适应输入的稀疏性与噪声。这一设计思路启示工程实践:在可控生成任务中,将高层语义推理与低层轨迹执行解耦,并引入不确定性建模,是提升生成结果物理可信度的有效路径。

行业影响

落地场景

MotiMotion 的核心能力是 运动控制视频生成,通过视觉推理补全用户稀疏、不精确的轨迹,并生成因果合理的次级运动。该技术可深度嵌入 内容创作工具(如视频编辑套件、AI 动画生成平台)、虚拟数字人驱动(直播、客服)、电商产品展示(动态广告)、游戏过场与特效 等场景。尤其适合需要快速将静态图转化为动态视频,且运动需符合物理常识的业务。

商业价值

  • 降本:减少逐帧动画或物理模拟的人工成本,用户仅需绘制几条关键轨迹即可生成逼真视频,将视频生产时间从天级降至分钟级,尤其利好中小型设计团队。
  • 增收:更自然、交互感更强的视频可提升广告点击率(CTR)与转化率,例如电商商品视频或社交媒体内容。
  • 体验升级:与现有运动控制方案相比,MotiMotion 能主动预测次级运动(如花瓣被推开后的飘落轨迹),输出结果更可信,降低“恐怖谷”效应,提升消费级应用的留存。

与现有产品/工作流集成

该框架可作为 推理增强模块 插入现有视频生成管线。其训练免费的视觉语言推理器(VLM Reasoner)和置信度感知控制机制,均可通过 API 或插件形式对接:

  • 视频编辑软件(如 After Effects 脚本):用户绘制主轨迹,MotiMotion 负责推理因果运动并生成视频序列,导出为图层。
  • 云视频生成平台(如 RunwayML、Pika):作为可控生成的高级选项,在运动笔刷功能背后调用 VLM 推理进行轨迹优化与补充。
  • 游戏引擎(如 Unity、Unreal):为 Timeline 动画提供程序化动作生成,角色/物体的次级动画可自动跟随主角交互产生。

具体落地 Use Case

  1. 电商3D商品展示:商家上传一张咖啡冒热气的图片,画出蒸汽上升的方向,MotiMotion 不仅生成蒸汽沿轨迹上升,还会根据气流推理出杯口附近部分蒸汽的漩涡与消散,避免漂浮硬伤,生成可直接投放的短视频广告。
  2. 社交媒体特效模板:在短视频创作工具中,提供“让花朵绽放”模板,用户仅需在花瓣上画一条拨动线,系统自动生成花朵颤抖、花粉飞散、茎叶回弹等连锁反应,普通用户零基础输出动画特效,提升平台内容供给质量与用户活跃度。

局限

  • - **推理器带来额外开销与不确定性**:MotiMotion 依赖 VLM 推理器进行轨迹细化和次要运动幻想,这会显著增加推理延迟和计算成本,尤其在实时或低延迟场景下难以部署。VLM 输出的质量高度依赖其视觉常识能力,若 VLM 在开放域产生幻觉或因果推理错误,会直接导致生成的视频出现不符合物理规律的运动,且该错误无法通过生成器自身纠正。
  • - **置信度估计依赖启发式设计**:置信度感知控制模块的置信度计算方式未明确给出通用定义,可能依赖手工规则或额外模块,泛化到不同生成模型或数据域时需重新调优。若置信度估计不准确,可能导致控制过强放大伪影或过弱丢失用户意图,影响最终运动自然性与操控精度之间的平衡。
  • - **基准 MotiBench 的场景覆盖有限**:新构建的 MotiBench 聚焦于运动触发新事件的交互场景,但数据集规模与多样性可能不足以覆盖现实世界的所有交互类型(如流体、形变物体)。仅基于 VLM 评分和主观评价的评估可能对复杂物理交互的评判不够客观,无法全面衡量真实物理合理性。
论文Lee Hsin-Ying2026-05-21原文

相关内容