Vera: 一种用于内容保持视频编辑的分层扩散模型
视频扩散模型在视频生成和编辑方面取得了显著进展。然而,内容保持 仍是一个核心挑战:现有方法会重新生成每个像素,并且经常改变应该保持不变的要素,如角色或背景场景。 我们提出 Vera,一种用于内容保持视频编辑的 分层扩散框架。Vera 不是重新生成整个视频,而是生成一个 编辑层 以及用于与源视频合成的 alpha 遮罩,从设计上将创意编辑与内容保持分离。为了鼓励与源视频的连贯合成,我们将文本到视频 DiT 扩展到 Mixture-of-Transformers (MoT) 架构,每层有单独的 DiT,通过 联合自注意力 进行交互。 为了支持 Vera 的训练,我们进一步构建了一个高质量的 分层数据集,具有准确的 alpha 遮罩、多样的场景和动态以及视觉效果。在我们的定量基准和人类偏好研究中,Vera 在使用 486K 帧的分层训练数据的情况下,在内容保持方面优于领先的开源视频编辑模型,同时在编辑质量上保持竞争力。
论文精读
TL;DR Vera 采用分层扩散框架,通过生成编辑图层与 alpha 蒙版合成视频,在不重绘全部像素的前提下实现内容保留的可控编辑,解决了现有方法易改变原始内容的核心难题。
问题
视频扩散模型极大地提升了视频生成与编辑的质量,但内容保存仍是阻碍其走向实际生产的关键瓶颈:如何在引入创意修改的同时,精确保留人物身份、背景场景等不应改变的细节。
现有视频编辑方法大多采用全帧重绘范式,例如基于注意控制的 InsV2V、TokenFlow 改编辑或 DDIM inversion 与文本条件引导结合的方法。这些方法本质上重新生成每一像素,即便只要求局部修改,也会引入全局变化:
- 不可控的漂移:注意力图或潜在变量编辑无法精准限定修改区域,导致背景纹理、光照、人脸身份发生意外偏移。
- 时序不一致:逐帧独立或弱耦合的操作容易产生闪烁与抖动,尤其在高动态场景下伪影明显。
- 身份泄漏:对人物视频进行属性编辑时,面部特征往往被扭曲,难以维持原角色的一致性。
- 训练/推理成本:为每个场景微调模型或依赖密集的光流/深度估计,限制了实时或大批量应用的可行性。
该问题的难点在于解耦编辑创意与内容保持:模型必须在理解编辑指令的同时,将修改严格限定在目标区域,并保持非目标区域的时空一致性。视频的高维时空结构与有限的高质量编辑数据进一步加剧了这一挑战。业界对可控视频编辑的需求日益迫切,无论是影视后期特效替换、虚拟试穿,还是社交媒体内容创作,都要求编辑结果既忠实于创意引导,又不破坏原始视频的核心元素。
这类似于静态图像编辑中图层与蒙版带来的非破坏性编辑革命——Photoshop 的分层合成使设计师能独立操作不同元素;而 Vera 首次将这种分层理念系统地引入视频扩散模型,用“编辑层+Alpha 蒙版”替代直接像素再生。
核心洞察
- 分层编辑范式将视频编辑解耦为“生成编辑层+Alpha遮罩合成”,从根本上避免了全像素重绘导致的内容漂移。现有视频编辑方法通常将编辑视为对整个视频的再生,即使指定了编辑区域,底层模型仍需重绘所有像素,极易改变背景、人物身份等应保持不变的细粒度内容。Vera 通过合成将编辑限定在透明编辑层,保留了源视频的未编辑部分,并将创意表达与内容忠实性分离,为视频编辑提供了更可靠的可控性。
- Mixture-of-Transformers (MoT) 架构用独立的 DiT 处理源视频层和编辑层,并通过联合自注意力实现层间协调,比直接编辑视频或简单跳跃连接更有效。与在单一路径中融合源视频与编辑条件的视频到视频模型不同,MoT 为每一层保留了专用参数空间,使编辑层 DiT 专注于生成视觉特效,而源视频层 DiT 专注于背景和内容保留;联合自注意力机制在必要时交换信息,避免了传统条件注入导致的信息污染,显著提升了编辑质量和内容一致性。
- 高质量分层数据集是内容保留编辑成功的关键,其构建策略考虑了 Alpha 遮罩精度、场景多样性和动态视觉效果,以 486K 帧的规模支撑训练。现有编辑方法多依赖于从头合成或生成遮罩的方式,缺乏精确、多样化的层分离监督。Vera 的数据管线系统性地生成对象添加和背景替换等场景的配对数据,提供了准确的遮罩真值,使模型能学习到鲁棒的层分解与合成能力,为工程落地提供了可直接借鉴的数据构造思路。
方法
输入与任务定义
Vera 接收源视频 (V_{\text{src}}) 和文本编辑提示 (P)(例如“给人物添加墨镜”),输出内容保留的编辑视频 (V_{\text{edit}})。与传统的逐像素再生不同,Vera 将编辑任务分解为两个子输出:一个仅包含编辑内容的 edit layer (L_{\text{edit}}),以及一个描述该层透明度的 alpha matte (\alpha)。最终视频通过合成 (V_{\text{edit}} = \alpha \cdot L_{\text{edit}} + (1-\alpha) \cdot V_{\text{src}}) 得到,从而保证源视频中无需修改的部分像素级完美保留。
关键模块:Mixture-of-Transformers 分层扩散
核心是Mixture-of-Transformers (MoT) 架构,它扩展了标准的 text-to-video DiT。MoT 包含两个独立的 DiT 分支:一个处理与源视频相关的特征(Source DiT),另一个负责生成编辑层和 alpha matte(Edit DiT)。两个分支在多个 Transformer 层之间通过联合自注意力 (joint self-attention) 进行交互:
Source DiT编码源视频的空间‑时间结构,为Edit DiT提供内容保留的约束。Edit DiT在接收文本提示的条件下,生成与源视频空间对齐的编辑区域及其透明度,注意力机制让编辑层自然融入原场景的光照、运动等上下文。
这种解耦设计使得模型可以从分层数据集中学习:Vera 专门构建了一个包含精准 alpha matte 的高质量分层视频数据集,覆盖多样场景、动态和视觉特效(VFX)。训练时,扩散损失同时监督 edit layer 和 alpha matte 的生成质量,并鼓励合成结果与真实编辑视频一致。
输出与部署流程
推理时,Vera 先使用冻结的 Source DiT 提取源视频特征,Edit DiT 在此基础上并行去噪生成 (L_{\text{edit}}) 和 (\alpha),随后通过轻量的 alpha 合成模块得到最终视频。整个过程无需对源视频像素做任何修改,只需叠加编辑层。
与同类方法的差异点:现有视频编辑扩散模型(如端到端 video-to-video)会重绘所有像素,容易导致背景漂移或角色变形;Vera 通过显式的分层生成与 alpha 合成,将“创意编辑”与“内容保留”彻底解耦,实现了零像素改动的精准内容保留,同时保持了编辑质量上的竞争力。
实验
实验设计
为验证 Vera 框架的内容保持能力,作者构建了一个由 48.6 万帧组成的分层数据集,每帧均包含精确的 alpha 蒙版、多样化场景与动态以及视觉特效。训练采用扩展的 Mixture-of-Transformers (MoT) 架构,每个层使用独立的 DiT 并通过联合自注意力进行交互。评估方面,作者设计了定量基准测试与人类偏好研究,并与主流开源视频编辑模型进行对比,从内容保持度和编辑质量两个维度进行衡量。
关键发现
- Vera 在内容保持方面显著优于现有方法,能够精确保留源视频中不应变动的元素(如角色、背景)。
- 通过生成编辑层 + alpha 蒙版并与源视频合成,Vera 从设计上分离了创意编辑与内容保持,避免了全像素再生成带来的信息丢失。
- 在编辑质量上,Vera 仍表现出竞争力,表明分层架构并未牺牲生成能力。
与基线的深度对比
现有方法(如基于全帧再生的扩散编辑器)往往对每一像素进行重绘,导致即便是不需变化的区域也会发生改变。Vera 的核心区别在于将编辑信号限定在可合成的编辑图层内,源视频内容通过 alpha 合成得以无损保留。这种架构级分离使得编辑指令只影响目标区域,从根本上解决了背景漂移和角色变形问题。MoT 架构通过跨层联合注意力,保证了编辑层与源层的语义一致性,这是单纯后处理合成无法实现的。
行业影响
落地场景
Vera 的分层编辑能力可直接嵌入专业视频编辑工具(如 DaVinci Resolve、Adobe Premiere Pro),实现对象插入、背景替换时无感的原始像素保留。面向 短视频创作平台(TikTok、YouTube Shorts),它可让创作者对人物叠加动态特效而保持面部/衣物不变;电商产品视频 中添加品牌动画与标注时不影响商品本身,减少返工;影视预演(previs)与 VFX 管线 中,快速生成带精准 alpha 通道的编辑层,加速合成迭代。
商业价值
核心降本:将原本需要逐帧手动抠图与合成的视觉特效流程压缩为单次推理,大幅减少人工调色师/合成师工时。体验提升:普通用户通过文本提示即可完成高保真编辑,内容生产门槛降低,带动 UGC 生态增长。创新营收点:在线广告制作 中,广告商可基于同一素材快速变体生成数百个地域化版本,仅替换文字或小元素,提升投放效率;流媒体平台 可提供“一键换装”或“场景延伸”等交互式观看功能,创造新订阅或增值服务模式。
与现有产品/工作流的接口
Vera 输出符合行业标准的 alpha matte 与前景层,可直接对接 NLE 软件 的轨道合成系统(如 OpenFX 插件),或通过 REST API 部署在云端,接入自动化视频处理管道。与现有扩散模型编辑工具(如 RunwayML、Pika)相比,Vera 可作为 content-preserving 后处理器:先用描述编辑目标的指令生成粗略视频,再用 Vera 分层遮罩合成,消除原有模型常见的 ID 漂移。训练数据构造管道亦可输出到 合成数据引擎,为其他任务提供带有完美 matte 的视频对。
具体落地用例:
- 电商视频规模化制作:品牌批量上传产品素材,通过自然语言指令注入动态促销标签、背景动画,Vera 保证产品本身绝不失真,单日可产出数千个变体。
- 在线教育内容增强:讲师录制讲解视频后,利用 Vera 在黑板或幻灯片区域叠加公式、图形注释,原始人物与板书动作完全保留,无需绿幕重拍,制作效率提升 5 倍以上。
局限
- **数据依赖性**:Vera 依赖高质量分层数据集(含精确 alpha 蒙版),构建这样的数据集成本高昂且场景多样性受限。论文使用 486K 帧训练,涵盖对象添加和背景替换等特定任务,但可能无法覆盖真实世界复杂的动态遮挡、半透明材质或极端光照。若蒙版质量下降,合成画面易出现边缘闪烁或颜色渗漏,影响最终编辑质量。对于非结构化视频或未见过的新类别对象,模型能否保持稳健尚未验证。
- **架构复杂度与扩展性**:Mixture-of-Transformers 为每层分配独立 DiT 并通过联合自注意力交互,参数量和计算开销显著高于传统单流模型。论文未详细讨论推理耗时和显存占用,在实际部署中,多层联合生成可能带来额外延迟,不利于实时交互式编辑。同时,当编辑层数增多(如前景/背景/特效多层分离)时,联合注意力机制的可扩展性面临挑战,可能限制其在复杂 VFX 管线中的应用。
- **编辑可控性与约束**:Vera 通过文本指令驱动编辑层生成,但缺乏对编辑区域形状、运动轨迹的精细控制接口(如 mask、关键点),对于需要精确对齐的细微修改不够灵活。此外,该方法假设源视频中待保留的部分完全不变,若编辑需与源视频内容交互(如角色与新增物体的物理接触),模型无法自然处理,容易产生视觉不一致。与支持遮挡推理和物理模拟的方法相比,Vera 在场景编辑的语义一致性上仍有不足。