论文

DomainShuttle: 自由开放域主题驱动文本到视频生成

DomainShuttle: 自由开放域主题驱动文本到视频生成

开放域主题驱动文本到视频生成(S2V)在学术界和工业界引起了广泛关注。开放域S2V主要涉及两种场景:域内场景,需要尽可能保留参考主题特征;跨域场景,在保留主题内在特征的同时,允许与主题无关的属性根据文本提示灵活变化。现有方法主要侧重于最大化域内场景中的主题保真度,这限制了它们在跨域场景(如新颖风格、语义组合或域属性)中的可编辑性和适应性。 本研究提出,理想的S2V方法应能在不同域之间灵活穿梭,在域内和跨域场景中均表现出色。为此,我们提出了DomainShuttle,能够实现开放域视频个性化中的高保真度和生成灵活性。具体而言,我们引入了Domain-MoT,该机制将视频和参考特征解耦,并引入域感知的AdaLN用于参考图像的域特定建模。随后,我们提出了视频-参考双RoPE方案(Video-Reference DualRoPE),将参考图像令牌和视频令牌置于独立的RoPE空间中,以实现精确的主题级空间建模。此外,跨对一致性损失(Cross-Pair Consistent Loss)旨在提取不受无关特征影响的内在主题特征。 大量实验表明,DomainShuttle相比现有方法取得了显著性能提升,在多种开放域应用场景中展现出高主题保真度和生成灵活性。

论文精读

TL;DR DomainShuttle 让开放域主体驱动视频生成在保持高保真( in-domain )的同时,首次实现跨风格、语义和属性的灵活编辑( cross-domain ),核心在于领域感知建模与双重 RoPE 方案。

问题

问题背景

Open domain subject-driven text-to-video (S2V) 生成聚焦于让视频既保留参考主体的核心特征 (in-domain),又能根据文本提示自由改变风格、场景等非本质属性 (cross-domain)。这是个性化视频生成走向实用的核心需求。

现有方法局限

当前方法 (如 VideoBoothDreamVideo 等) 主要针对 in-domain 场景设计,通过直接将参考图像特征注入扩散模型来最大化主体保真度,但存在以下局限:

  • 特征纠缠:主体身份(如人脸、物体结构)与背景、光照、姿态等无关特征在编码阶段耦合,缺乏显式解耦。
  • 过拟合与编辑退化:在 cross-domain 场景(如要求“油画风格的猫”或“在火星上骑摩托的人”)中,模型难以区分哪些属性应保留、哪些应改变,导致主体质感下降或违背提示词。
  • 空间建模粗糙:统一的位置编码(RoPE)同时处理视频 token 和参考图像 token,使主体级空间关系被噪声淹没,微调时容易丢失几何一致性。

技术挑战与重要性

该问题的根本难点在于 解耦表征学习与条件注入的粒度控制。视频扩散模型需要同时维持时序流畅性、主体身份一致性和对文本的语义对齐,三者之间存在优化冲突。现有的单分支注入方式或全局重加权策略无法为每一帧动态平衡“保留”与“变化”的权重。业界对个性化短视频生成(如虚拟数字人、交互式广告、影视预演)的需求日益强烈,但当前 S2V 方案通常仅能在忠实复现或自由创作之间二选一,未能实现“一次训练,跨域泛用”,这严重制约了生产级工作流的搭建。

行业类比

这类似于 Dreambooth 在图像生成中遇到的过拟合与编辑困难——若微调时没做好正则化,模型会忘记如何生成主体在其他场景下的变体。DomainShuttle 相当于为视频生成引入了一种“主体解耦适配器”,类似 IP-Adapter 对图像可控性的提升,但面向更复杂的时空一致性与跨域自由编辑需求。

核心洞察

  • - **领域解耦与适配**:DomainShuttle 通过 Domain-MoT 将参考主体特征与视频生成过程解耦,并引入领域感知的 AdaLN,使模型能在“保持身份”与“自由编辑”之间灵活切换。与现有方法直接注入参考特征导致过拟合不同,这种设计同时保障了高保真度和跨域生成的可编辑性,首次在开放域视频个性化中实现域间穿梭。
  • - **位置编码分离**:Video-Reference DualRoPE 将参考图像 token 与视频 token 置于独立的 RoPE 空间,允许主体级空间建模时,参考位置不受视频全局运动的干扰。相比共享位置编码的方案,该机制避免了参考特征对生成的过度约束,使模型能精准保留主体姿态与相对位置,同时灵活响应文本中的动作和场景变化。
  • - **跨对一致性学习**:Cross-Pair Consistent Loss 通过构建成对样本,迫使模型学习与视角、光照等无关的主体内在特征。这一损失函数无需额外标注即可强化身份一致性,在跨域生成中显著减少外观畸变,将主体相似度与编辑自由度解耦,为开放域场景下的可靠视频个性化提供了新的监督范式。

方法

DomainShuttle 以文本提示和参考主体图像为输入,通过三大核心模块实现开放域主体驱动视频生成。

输入处理:文本提示经 CLIP 文本编码器提取语义特征;参考图像通过视觉编码器转换为参考 token,保留主体外观信息。

关键模块

  1. Domain-MoT(域感知混合专家):将视频生成与参考特征解耦,引入 domain-aware AdaLN(自适应层归一化)。该模块根据任务是域内(高保真还原)还是跨域(灵活编辑),动态调制 DiT 块中的归一化参数,使参考特征注入具有领域特异性,避免过拟合单一场景。
  2. Video-Reference DualRoPE:引入双旋转位置编码空间,分别将视频 token 和参考图像 token 置于独立的 RoPE 空间中。通过各自的频率与相位编码,模型能精确建模主体在视频帧中的空间位置关系,而非简单混入参考特征,从而实现主体级空间对齐,保留细节同时允许非主体区域按文本自由变化。
  3. Cross-Pair Consistent Loss:利用成对样本(如同一主体的不同姿态/背景)训练,强制模型提取主体内在不变特征。对比损失拉近正样本对的主体表征,推开负样本,抑制背景、视角等无关属性对主体身份的影响。

训练与输出:训练数据通过自动化管道构建,覆盖多主体、多领域视频-参考对。推理时,模型根据文本和参考图像生成视频,输出在保持参考主体身份的同时,遵循文本描述的动作、场景与风格。

与通常仅优化域内保真度、导致跨域编辑僵化的先前方法(如 DreamVideo、VideoBooth)不同,DomainShuttle 通过域感知解耦与独立空间建模,真正在域内高保真和跨域灵活性之间取得平衡

实验

实验设计

DomainShuttle 针对开域主体驱动文本生成视频任务,涵盖 域内(保留参考主体特征)与 跨域(保持内在特征,灵活改变无关属性)两种场景。实验设置包括:构建训练数据管道,训练中引入 Domain-MoT(域感知自适应层归一化)、Video-Reference DualRoPE(视频-参考双旋转位置编码)和 Cross-Pair Consistent Loss(跨对一致性损失)。测试数据集覆盖多种开域场景,评估指标包括主体保真度、文本对齐度、生成灵活性,并进行定量比较、定性示例展示以及人类偏好评估。消融实验系统验证各组件贡献。

关键发现

  • 域感知建模有效解耦视频与参考特征,实现域内/跨域性能的共同提升。
  • Video-Reference DualRoPE 将参考图像标记和视频标记置于独立 RoPE 空间,增强主体级别空间定位精度。
  • Cross-Pair Consistent Loss 提取本质主体特征,抑制无关特征干扰,确保跨域编辑时身份一致性。
  • 实验表明 DomainShuttle 在保持高主体保真度的同时,在跨域风格、语义组合等场景展现出优异生成灵活性和可编辑性,显著优于现有方法。

与基线对比

现有方法(如 VideoDreamer 等)主要聚焦域内保真度最大化,强制保留参考主体所有特征,导致跨域场景下对风格、背景等编辑的适应性不足,可编辑性受限。DomainShuttle 通过领域解耦和双 RoPE 等设计,突破了这一局限:域内场景保真度不降,跨域场景则允许主体无关属性按文本提示灵活变换,真正实现了在不同域间“穿梭”。这种对开域个性化视频生成范式的重新思考,为未来更通用的生成模型提供了工程启示——即分离身份相关与身份无关的表示是提升开放世界适应性的关键路径。

行业影响

落地场景

主题驱动的视频生成 在多个工业场景具有直接落地潜力:

  • 电商与广告: 用户上传商品参考图 (如一双鞋、一件家具),通过文本描述场景、风格、动作,即可生成展示视频,替代高昂的实拍。DomainShuttle 的跨域灵活性允许同一商品在不同风格 (写实、卡通、3D) 中自由穿梭,大幅提升素材多样性。
  • 内容平台与短视频创作: 创作者提供角色或道具照片,输入创意提示词,即可快速生产个性化视频片段,降低 UGC 门槛。
  • 影视与虚拟制片: 基于演员定妆照或场景概念图,生成带交互的预览视频,辅助前期筹备。

商业价值

  • 降本: 传统视频素材拍摄需场地、模特、后期,成本高且周期长。DomainShuttle 将单条素材生成成本压缩至近乎零边际成本,尤其适用于需要海量变体的效果广告。
  • 增收: 高质量、高灵活性的个性化视频可提升广告点击率与转化率,或增加平台用户付费意愿。
  • 体验提升: 真正“所见即所得”的生成能力允许用户实时调整提示词,交互式创作,增强沉浸感与工具粘性。

与现有产品/工作流的接口

  • 即插即用的 API 化: DomainShuttle 可作为视频生成微服务嵌入 MLOps 管线,通过标准 RESTful 接口接收参考图 + 提示词,返回视频。与现有 AIGC 平台 (如 ComfyUI 节点、Diffusers 管道) 对接只需实现一个节点/包装器。
  • 数据闭环集成: 生成视频经人工或自动评估后,反馈到 Cross-Pair Consistent Loss 的对比学习更新中,持续提升保真度与解耦质量。可与 A/B 测试平台联动,根据业务指标 (如播放完成率、点击率) 自动筛选高质量提示词-参考图组合。

具体落地 Use Case

  1. 时尚电商 的虚拟试穿与展示: 用户上传一件印花 T 恤的平铺图,输入提示词“一位街头风格模特穿着这件 T 恤在东京霓虹灯下行走”,DomainShuttle 生成视频时既能保持 T 恤图案细节不变 (高保真),又能让模特姿势、环境、光影根据文本变化 (高灵活性)。输出可直接用于商品详情页或信息流广告。
  2. 品牌 IP 运营: 公司拥有的吉祥物或虚拟角色,输入参考图,配合“骑滑板穿越赛博朋克城市”等场景描述,批量生成品牌短视频素材,用于社交媒体传播。通过 VR-DualRoPE 分离角色与视频 token 的 RoPE 空间,确保角色特征在极端视角下仍不扭曲。

局限

  • 论文主要关注单目标主体的视频生成,在多主体共存或主体间交互的场景下,尚未验证方法能否准确解耦并独立控制各主体特性;训练数据依赖人工构造的合成数据集,尽管覆盖了部分跨域变化,但真实世界开放域中的长尾分布和复杂组合可能仍会导致泛化能力下降。
  • Domain-MoT 和 VR-DualRoPE 的设计在推理时对参考图像和文本条件的敏感性未做充分分析,极端 prompt(如大幅改变主体空间位置或极端风格)下可能产生主体变形或与文本不对齐的结果;论文也未讨论该方法对低质量或遮挡严重的参考图像的鲁棒性。
  • 与当前主流的基于 IP-Adapter 或 ControlNet 的轻量级适配方案相比,DomainShuttle 引入了额外的领域感知模块和双 RoPE 空间,可能增加推理计算开销,而对实时或低资源场景的适配性未做评估;同时,消融实验仅量化了各模块的贡献,未深入探索不同领域解耦策略对最终视频质量的影响边界。
论文Nan Chen2026-06-24原文

相关内容