论文

Go-with-the-Track: 基于点轨迹的视频合成与运动控制

Go-with-the-Track: 基于点轨迹的视频合成与运动控制

电影制作需要精确的运动控制和参考图像合成,但现有方法将两者分开处理。点轨迹条件图像到视频模型限制内容插入到首帧,而参考到视频模型缺乏对参考内容跨帧集成的细粒度时空控制。 我们提出 Go-with-the-Track,通过联合条件于多个参考图像和参考锚定点轨迹,统一了这两种能力——将常规点轨迹扩展为明确建立生成帧与参考图像之间的对应关系,从而在整个视频中实现精确合成与运动控制。为此,我们引入空间感知点轨迹嵌入,使用坐标级MLP后接时间池化编码完整的点轨迹坐标序列。这种表示捕捉每个点轨迹的空间特征(作为唯一标识符),且嵌入相似度直接与空间邻近度相关,增强了模型区分和关联点轨迹的能力。通过轻量适配器将这些嵌入注入视频扩散Transformer,解决像素到补丁分辨率不匹配,同时避免朴素点轨迹下采样中固有的运动细节损失。 我们采用混合训练策略,在动态、静态和合成场景视频数据集上联合训练,以提升运动可控性。实验表明,Go-with-the-Track 在单一模型中实现了优越的运动与参考控制,并支持新能力:多参考条件视频生成和点轨迹驱动的合成,以及静态与动态场景的相机控制。

论文精读

TL;DR Go-with-the-Track 在单一视频扩散模型中统一运动控制与多参考图像合成,利用空间感知点轨迹嵌入实现帧级精准合成与运动操控。

问题

问题背景

视频生成领域正从单纯的文本到视频(T2V)向更精确的时空控制演进,尤其是在电影制作、广告特效等专业场景中,需要同时实现参考图像合成精细运动控制——例如将特定产品图像无缝植入动态视频,并使其严格遵循预设的运动轨迹。

现有方法局限

当前主流方案存在明显割裂:

  • 点轨迹条件(point-track-conditioned)I2V 模型(如 DragNUWA、Motion-I2V)仅支持在第一帧注入参考内容,后续帧依靠稀疏轨迹引导,无法处理多参考图像或中途替换内容的需求,且点轨迹与参考图像的对应关系未显式建模,导致合成区域易出现抖动、形变。
  • 参考到视频(reference-to-video)模型(如 ConsistI2V、AnimateAnyone)虽能保持主体外观一致性,但缺乏逐帧的空间-时间精细控制,只能通过文本粗略描述运动,无法指定像素级跟踪或局部元素独立动画。 两者均无法满足电影级制作中“多源参考内容 + 可编辑运动轨迹”的复合需求。

为什么这个问题难且重要

核心挑战在于如何让模型同时理解“什么内容在哪里”以及“内容如何运动”。参考图像提供外观信息,点轨迹提供几何对应,但两者源自不同特征空间,简单拼接或交叉注意力难以建立稳定关联。此外,视频扩散模型在潜在空间进行 patch 化操作时,原始点轨迹的像素级精度极易丢失,导致运动细节模糊。业界对统一的可控视频生成框架需求强烈:它能够降低影视后期成本,并催生面向普通创作者的交互式编辑工具。Go-with-the-Track 正是瞄准这一空白,通过空间感知的点轨迹嵌入和轻量适配器,首次在单一模型中融合多参考合成与轨迹驱动运动控制。

行业类比

类似自动驾驶中需将高清地图元素(参考图像)与车辆运动规划(点轨迹)联合建模,视频编辑同样需要场景元素在时空上的精确配准与动态演绎。

核心洞察

  • **统一运动控制与参考图像合成**:现有方法将点轨迹条件(仅支持首帧插入)与参考图像条件(缺乏精细时空控制)割裂。Go-with-the-Track 首次引入参考锚定点轨迹,显式建立生成帧与参考图像的对应关系,使视频全过程的合成与运动控制得以统一,突破了传统单模型功能的边界。
  • **空间感知点轨迹嵌入**:通过逐坐标 MLP 与时间池化,点轨迹嵌入既编码空间唯一标识,又使相似度与空间邻近性正相关。这种设计避免了朴素子采样造成的运动细节损失,并借助轻量适配器注入视频扩散 Transformer,解决了像素到 patch 的分辨率失配问题,为高精度控制奠定了基础。
  • **混合训练策略提升运动可控性**:联合动态、静态与合成场景视频数据集训练,使单一模型既能处理真实世界复杂运动,又能从合成数据中学习精确控制信号。实验证明该策略有效支撑多参考图像条件生成、点轨迹驱动合成及相机控制等新能力。

方法

任务定义与输入

Go-with-the-Track 将视频生成建模为联合条件生成任务,输入包括:

  • 多张参考图像 (reference images),提供待合成物体的视觉外观;
  • 参考锚定点轨迹 (reference-anchored point-tracks),即一组跨帧的 2D 坐标序列,显式定义参考图像中关键点在各生成帧中的对应位置。

空间感知点轨迹嵌入

模型将每条点轨迹编码为紧凑且可区分的向量。具体流程:

  1. 坐标级 MLP:对每帧的 (x, y) 坐标独立投影到高维空间;
  2. 时间池化:对所有帧的特征进行平均或最大池化,得到固定长度的轨迹嵌入。

这种 spatially-aware point-track embedding 使得:

  • 嵌入相似度与轨迹间的空间距离强相关,即物理上接近的点拥有相近的嵌入;
  • 每条轨迹的嵌入可作为唯一标识符,帮助模型区分不同物体或不同部位的移动路径。

注入视频扩散 Transformer

点轨迹嵌入通过一个轻量级适配器注入到视频扩散 Transformer 的某些层中。适配器负责:

  • 解决像素级轨迹与潜在空间图像块 (patch) 之间的分辨率不匹配问题;
  • 避免简单对轨迹降采样造成的运动细节丢失,而是通过可学习的跨注意力或特征乘法将轨迹语义融入生成过程。

输出与训练策略

最终模型在给定参考图和轨迹条件下直接输出完整视频帧序列,同时实现精确合成 (物体跟随轨迹运动) 与外观保持。训练采用混合策略,联合使用动态、静态和合成场景数据集,提升运动可控性的泛化能力。

与仅依赖首帧点轨迹的图像到视频模型或缺乏细粒度时空控制的参考到视频模型相比,Go-with-the-Track 首次将多参考图像条件与跨帧点轨迹统一建模,在单一模型中同时实现高精度运动操控和参考内容合成。

实验

实验设计与评估框架

Go-with-the-Track 采用混合训练策略,在动态、静态及合成场景视频数据集上联合训练,以提升模型对多样化运动的可控性。评估涵盖定量指标、消融实验、定性对比以及多项应用演示,重点验证运动控制精度参考图像合成质量的统一表现。

关键发现

  • 统一能力突破:单一模型同时实现了精细的点轨迹运动控制多参考图像合成,这在之前工作中是相互割裂的。
  • 新应用解锁:模型支持多点轨迹驱动的多参考条件视频生成,以及静态与动态场景的相机控制,显著扩展了视频生成的创作边界。
  • 设计有效性:消融实验证实了空间感知点轨迹嵌入轻量适配器的关键作用——嵌入的相似性直接关联空间邻近度,增强了模型区分不同轨迹的能力;适配器在解决像素-补丁分辨率失配的同时,避免了朴素子采样带来的运动细节丢失。

与基线方法的深度对比

现有方法存在明显短板:点轨迹条件图像到视频模型将内容插入限制在首帧,无法在后续帧中动态调整参考内容;而参考到视频模型缺乏细粒度的时空控制,难以精确指定参考内容如何跨帧集成。Go-with-the-Track 通过引入参考锚定点轨迹,将传统点轨迹扩展为生成帧与参考图像之间的显式对应,从而在整个视频中实现精准合成与运动控制。这种联合条件设计不仅填补了功能鸿沟,更通过空间感知嵌入扩散Transformer注入的方式,在保持高效计算的同时,提供了远优于基线方法的时空控制精度。实验证明,该方法在运动连贯性和参考内容保真度上均达到领先水平。

行业影响

落地场景

Go-with-the-Track 将运动控制与参考图合成统一到单模型,直接服务于 视频编辑、虚拟制片、广告植入、游戏 CG 等需要精细时空合成的场景。例如:

  • 在实拍视频中无缝插入动态商品模型(如一双手持产品的运动镜头),创作者只需提供产品图与少量点轨迹,即可生成多角度运动视频;
  • 电影后期合成中,导演可通过点轨迹指定 CG 元素相对于参考物的移动路径,减少逐帧手工对位;
  • 社交内容平台可将其嵌入创作工具,让用户“贴”入个性化虚拟角色,并用手绘轨迹控制其运动。

商业价值

模型从三条线驱动价值:

  • 降本:省去传统运动匹配(matchmoving)与逐帧合成的人力,对于短视频量产、电商素材更新等高频需求,制作周期可从数天压缩到分钟级。
  • 增收:为 SaaS 视频编辑工具或云渲染平台提供差异化付费功能;广告平台可利用该技术动态替换场景中的广告位内容,创造新的可竞价库存。
  • 体验提升:非专业用户也能生成“专业级”运动合成效果,降低创作门槛,增强用户粘性与内容供给量。

与现有产品/工作流的接口

模型采用轻量 adapter 注入 video diffusion transformer,可插拔式兼容主流视频基础模型(如 Wan、Kling 等)的推理 pipe。集成路径清晰:

  1. 在现有扩散推理服务中,加载 adapter 权重,将点轨迹输入映射为额外条件 token,无需改动基座模型架构。
  2. 提供 API 接口:输入参考图 + 点轨迹序列,输出合成视频;可用于 After Effects 插件、DaVinci Resolve OFX 插件或云端视频编辑 SDK。
  3. 混合训练策略(动态/静态/合成场景)使模型能直接处理真实用户上传的 RGB 视频与参考图,降低预处理成本。

具体落地用例

  • 电商商品视频生成:运营人员上传产品白底图与一段手持场景视频,在首帧标记商品锚点并绘制运动轨迹,即可生成“手持展示”视频,避免反复实地拍摄。
  • 内容平台创作者工具:视频博主在 Vlog 中描绘轨迹,实时合成虚拟宠物或字幕特效,与镜头运动同步跟随,增强互动感而不需要专业 3D 软件。

局限

  • **点跟踪质量依赖**:本方法的核心驱动力来自参考图像锚定的点跟踪轨迹,因此点跟踪的精度直接影响生成视频中运动与参考内容贴合度。论文在静态与动态场景上评估,但未讨论当点跟踪算法(如 TAPNet 等)在面对剧烈遮挡、快速运动或纹理缺失区域时,插入的参考对象可能发生漂移或错位。此外,训练时使用的点跟踪数据来自自动标注(如用 flow 或 tracker),其噪声可能在扩散模型中被放大。尽管作者提出了空间感知嵌入来增强点区分能力,但实际极限未量化,可能导致精细控制失效。
  • **多参考图像扩展性**:Go-with-the-Track 支持多参考图像条件生成,但论文未深入探讨随参考图像数量增加时的计算成本与注意力交互复杂度。当每个参考图像都关联多条点轨迹时,适配器需要注入的 token 数目线性增长,可能限制高分辨率长视频下的实时应用。实验定性展示仅涉及少量参考图,缺乏对更大规模(如数十张图)的量化分析,因此该能力在复杂电影级合成中的可扩展性存疑。
  • **训练数据与域泛化**:混合训练使用动态、静态和合成视频数据集,但合成数据(如摄像机运动模拟)可能与真实影视片段存在域 gap,导致模型在真实素材上的运动控制能力下降。论文中没有在分布外数据(如手持拍摄、极端光照)上测试,且所提的相机控制仅限于内参变化,对于外参变化(如镜头切换)未知。此外,模型基于特定视频扩散主干(如 Wan),切换到其它 backbone 需要重新训练适配器,降低了通用性。
论文Koichi Namekata2026-06-18原文

相关内容