论文

OmniDirector: 无需交叉配对数据的一般性多镜头相机克隆

OmniDirector: 无需交叉配对数据的一般性多镜头相机克隆

从参考视频中克隆相机运动是视频生成中的重要任务,因为视频能提供直观且精确的控制。现有方法要么直接使用参数化表示,无法处理多镜头生成;要么合成交叉配对数据,却受限于数据稀缺,导致复杂相机运动克隆效果不佳。为应对这些挑战,本文提出一种通用的相机运动表示——相机网格(camera grid),将相机参数编码为网格运动视频。该表示支持多镜头视频生成中不同轨迹的整合。在此基础上,我们提出 OmniDirector,一个统一的框架,在百万级相机网格-视频对上训练,协调人物、动作和相机,为多模态扩散变换器(multimodal diffusion transformers)提供导演级控制。此外,我们设计了一个新颖的 层次化提示扩展代理(hierarchical prompt expansion agent),通过系统描述相机运动和视觉内容并理解信号关系,和谐地整合不同的控制信号。大量实验表明,该框架在性能和控制性上均表现卓越。项目页面:https://ymlinfeng.github.io/OmniDirector.github.io/

论文精读

TL;DR OmniDirector 用网格运动视频作为通用摄像机表示,无需交叉配对数据实现多镜头摄像机运动克隆,赋予视频生成导演级可控性。

问题

问题背景

在视频生成领域,相机运动控制 是决定视觉叙事质量的关键因素。它不仅影响画面构图,还能传递情绪、引导注意力。当前业界正探索如何将参考视频中的相机轨迹精确迁移到生成内容中,即 相机运动克隆 ,以实现导演级的创作控制。

现有方法局限

  1. 参数化表示 (parametric representations):直接使用相机位姿参数(如平移、旋转、焦距)进行条件生成。这类方法在处理 多镜头视频 时严重受限,因为不同镜头的参数空间相互独立,难以表达连贯的跨镜头运镜逻辑,导致生成结果生硬或崩溃。
  2. 跨配对数据合成 (cross-paired data synthesis):为克服参数表示的不直观,一些工作尝试构建“参考视频-相机参数”配对数据来训练模型。但这类数据合成高度依赖人工标注或模拟,数据量稀缺且覆盖的相机运动模式有限,在复杂运镜(如摇晃、变焦、多轴联动)场景下泛化能力很差。

技术挑战与重要性

相机运动克隆的难点在于 多模态控制信号的统一与协调:同一生成过程中需要同时处理视觉内容、角色动作和相机轨迹,而这三者在传统框架中往往割裂治理。此外,真实拍摄中常见的 多镜头连续运镜(如推拉摇移跟)要求模型理解跨镜头的相机运动语法,这对表示方式和训练数据都提出了极高要求。工业界对可控视频生成的需求日益强烈,无论是虚拟制片、影视预演还是沉浸式内容,都迫切需要一种 通用、高保真的相机克隆方案,而非仅支持单镜头简单运动的玩具模型。

行业类比

这类似于自动驾驶仿真中需要为虚拟场景自动生成多样化、物理真实的传感器视角:如果只能复制单一固定镜头的运动,就远不能满足复杂动态场景的测试需求。

核心洞察

  • 将相机运动编码为网格运动视频(camera grid),将相机参数可视化为统一、连续的视觉表示,消除了多镜头生成时需要切换参数空间的限制。与主流的参数表示或文本描述不同,这种网格表示天然适合视频扩散模型,可直接通过视觉条件注入,并支持复杂相机特效(如推拉、摇移)与多镜头轨迹的自然拼接,避免了现有方法因表示不一致导致的多镜头断裂。
  • 无需合成或收集交叉配对数据,直接利用百万级相机网格-视频对训练,从根本上避开了数据稀缺对相机运动克隆泛化性的制约。现有方法常依赖生成交叉配对数据来监督相机控制,但数据质量与多样性不足,导致在复杂相机运动上表现差。OmniDirector 通过网格表示将相机运动与视觉内容解耦,使得任意视频均可与网格配对,极大降低了数据获取门槛,并借助层级式提示扩展代理协调多模态信号,实现导演级别的可控生成。

方法

输入与表示

  • 用户提供文本 prompt(描述角色、动作、场景)和参考视频(提供相机运动轨迹)。参考视频中的相机参数被转换为 Camera Grid 视频:一种密集、视觉化的运动表示,在空场景中以网格动画形式编码相机的位姿、焦距等,天然支持多镜头轨迹拼接与特殊效果(如 dolly zoom、摇镜)。

关键模块

  1. Camera Grid 注入:将相机网格视频 patch 化为 token 序列,通过 token 拼接 方式注入扩散 Transformer 的潜空间。在去噪过程中,网格 token 与视频 token 并行处理,使每帧生成都能感知对应的相机运动。
  2. 训练策略:在 百万级相机网格-视频对 上进行端到端训练,无需跨配对数据(cross-paired data)。模型学习协调网格运动与视频内容(角色、动作)的一致性,避免数据稀缺问题。
  3. 分层提示扩展代理(PE Agent):推理时,基于 LLM 的代理分析相机运动信号与文本提示的关系,生成结构化描述,层次化地融合运动语义(如“镜头左平移后慢推近”)与内容语义(如“人物挥手”),形成统一控制信号。
  4. 自适应无分类器引导(Adaptive CFG):根据每一步相机控制信号的强度动态调整 CFG 尺度,在强控制下避免生成失真,在弱控制下保证运动跟随性。

输出与差异

模型输出多镜头视频,相机运动精确复现参考轨迹,同时保持内容与提示一致。与现有参数化表示或跨配对数据合成方法不同,OmniDirector 通过统一的相机网格表示和分层提示代理,在扩散框架内同时协调角色、动作与相机,实现导演级控制,无需额外配对数据,泛化性更强。

实验

实验设计

OmniDirector 在自建百万级 相机网格-视频对 上训练,覆盖多镜头、不同轨迹与特效。评估集包含复杂相机运动序列,对比三种基线:参数式方法 (如 CameraCtrl)、跨配对数据方法 (如 VD3D) 及 文本描述方法。指标选用帧间运动一致性、视频质量 (FVD) 与用户偏好。

关键发现

相机网格表示能统一表达平移、旋转、变焦及特殊效果,支持多镜头无缝拼接。层次提示代理有效协调内容描述与相机控制信号,避免冲突。自适应 CFG 策略在保持视频质量的同时提升相机跟随精度。框架无需跨配对数据,缓解数据稀缺问题,在复杂轨迹克隆上显著优于基线。

对比解读

参数式方法在处理多镜头时参数不连续,导致跳变;跨配对数据方法受限于合成数据质量,在复杂轨迹下误差大。OmniDirector 的视觉网格编码天然保持时序平滑,且训练数据规模大,泛化能力强。提示代理将相机指令融入语义上下文,比简单拼接更鲁棒,实现导演级控制,为视频生成中的运动克隆提供了一种更通用、数据高效的新范式。

行业影响

落地场景

OmniDirector 提供的导演级相机控制能力可直接赋能多种视频生成产品:

  • 短视频创作平台:创作者上传参考视频即可一键克隆其相机运动,生成契合运镜逻辑的AI视频。
  • 影视预可视化与虚拟制片:导演通过相机网格快速预览复杂多镜头调度,降低前期沟通成本。
  • 游戏过场动画与交互叙事:自动生成符合特定镜头语言的动画内容,提升沉浸感。
  • 广告与电商营销视频:批量生成具有专业运镜效果的商品展示视频,保持多镜头风格统一。

商业价值

  • 降本增效:用视频参考替代传统相机参数的手工调节或昂贵动捕设备,使非专业用户也能获得电影级运镜,大幅降低内容制作门槛和周期。
  • 体验升级:多镜头无缝集成打破单镜头限制,使生成视频具备更丰富的叙事节奏和视觉冲击,直接提升用户观看时长与转化率。
  • 数据飞轮:无需跨配对数据即可训练,利于快速部署到不同垂直领域,降低数据采集成本的同时保持强泛化性。

与现有工作流的接口

  • 即插即用的生成管线模块OmniDirector 的核心是“相机网格视频”表示,可直接作为条件馈入主流扩散Transformer(如 DiT 架构),通过 token concatenation 注入,几乎无需改动原有模型结构。
  • 统一控制信号融合Hierarchical Prompt Expansion Agent 能自动协调文本、图像、相机等多模态信号,适合集成进现有的多模态提示工程工具链(如LangChain、ComfyUI节点)。
  • 推理阶段自适应调节Adaptive CFG 策略可在部署时动态平衡相机控制强度与画面质量,方便产品侧提供“运镜强度”滑块等直观操控。

具体落地 Use Case

  1. 全球化电商平台:为3C产品生成多角度展示视频时,直接用品牌宣传片中的运镜作为参考,批量克隆出数百个产品视频,既统一品牌调性,又节省专业导演跟拍费用。
  2. 在线教育内容生产:教育机构录制一次教师的讲解运镜(如推拉摇移突出知识点),之后即可将相机运动复用到所有新课程视频中,保持视觉风格一致,同时降低后期剪辑人力。

项目页:https://ymlinfeng.github.io/OmniDirector.github.io/ | GitHub: lisj575/OmniDirector

局限

  • - **训练数据依赖性**:OmniDirector 依赖百万规模的 camera grid-video 配对数据训练,但公开可用的高质量相机参数标注视频有限,实际训练数据可能由合成或简单场景构成,导致模型在真实世界的复杂镜头运动(如手持摇晃、快速变焦、鱼眼畸变)中泛化能力不足。此外,camera grid 作为一种视觉化表示,其粒度受网格分辨率限制,可能无法精细表达镜头畸变、传感器位移等专业相机参数,对电影级精确控制需求仍存差距。
  • - **多镜头一致性与长视频生成**:论文聚焦于多镜头生成,但未深入探讨跨镜头之间的时空一致性(如角色动作连贯、光影统一),长时间生成时 diffusion transformer 可能累积误差。目前框架的推理效率与显存占用未详细对比,百万级训练规模和扩散采样步骤可能限制其在高分辨率实时应用中的部署。缺乏预训练权重公开也可能阻碍后续研究复现与扩展。
  • - **与已有方法的对比深度**:虽然声称避免了跨配对数据合成,但 camera grid 本身需要从参考视频提取或手工设计,实际应用中仍需高质量相机轨迹数据预处理。与最新视频扩散模型(如 Sora 类方案)的对比仅限定量指标,未充分讨论在开放域文本驱动生成中的性能,以及导演级控制是否能覆盖所有创意意图(如艺术化运动模糊、帧率变化)。
论文Jiwen Liu2026-06-11原文

相关内容