论文

LoomVideo: 将多模态输入统一到视频生成与编辑中

LoomVideo: 将多模态输入统一到视频生成与编辑中

现有统一视频生成与编辑框架通常依赖大规模模型(13B 参数以上),并通过拼接序列令牌引入源视频条件,导致序列长度加倍,自注意力机制计算复杂度提升四倍,带来极大开销。 为克服这一瓶颈,LoomVideo 提出一种高效的 5B 参数 统一架构。它使用多模态大语言模型(MLLM)替换标准文本编码器,并采用 Deepstack 注入机制 对齐多层 MLLM 特征与扩散变换器(DiT)。关键创新在于引入零开销的 缩放-加法(Scale-and-Add) 条件方法进行视频编辑:通过缩放并直接添加干净源视频潜变量到噪声目标潜变量,无需令牌拼接,大幅降低计算成本,同时保持复杂非刚性编辑能力。此外,负时间 RoPE 策略被集成以处理多个参考图像。 大量实验表明,该紧凑模型在综合基准上达到最先进或极具竞争力的性能,尤其在电商和时尚生成场景中表现卓越。得益于零开销条件机制,LoomVideo 推理速度相比类似能力模型至少加速 5.41 倍,为高效视频基础模型奠定基础。

论文精读

TL;DR LoomVideo 用多模态大模型和零开销 Scale-and-Add 条件机制,实现高效(5B 参数)且推理加速 5.41 倍以上的统一视频生成与编辑。

问题

问题背景

统一视频生成与编辑模型正成为多模态 AIGC 落地的核心方向:工业界需要单个模型既能从文本 / 图像生成视频,又能对已有视频进行精细化编辑,且支持交错式多模态输入。

现有方法局限

目前的主流统一框架普遍存在两大瓶颈:

  • 模型规模过大:多数方案依赖 13B 参数以上的巨型架构,训练与部署成本极高,难以在消费级硬件上实时推理。
  • 编辑条件注入效率低:现有方法将源视频条件通过序列拼接注入扩散模型。这会导致 token 长度加倍,自注意力计算复杂度变为 O(4N²),推理开销急剧增长,严重限制实际吞吐。 该计算冗余在需要非刚性编辑(如衣物变形、动态场景)时尤为突出,因为拼接方式仍需处理完整的长序列。

技术挑战与重要性

实现轻量级、零开销的条件注入是核心难题:既要保留对复杂编辑的强控制力,又要避免序列拼接带来的算力膨胀。此外,多模态语义对齐要求模型能高效融合 MLLM 特征与 DiT 主干,否则轻量化会导致生成质量断崖式下跌。该问题在电商试穿、虚拟时尚、视频后期等高交互场景中价值极高——从业者期望模型在 5B 参数级别达到 13B 模型的水平,并实现数倍推理加速,从而推动视频基础模型从实验室走向规模化产品。

行业类比

与 Runway 或 Pika 等视频工具追求快速、可控的编辑体验类似,LoomVideo 的核心路径是通过架构创新用更少参数实现更快推理——如同 Llama 3 用更小参数量超越前代大模型,重新定义了效率与效果的平衡点。

核心洞察

  • Scale-and-Add 条件机制将干净源视频潜变量缩放后直接加到噪声目标潜变量上,完全消除传统条件方法中所需的 token 拼接步骤,从而避免自注意力序列长度翻倍带来的计算量四倍增长。这一设计与现有基于拼接的统一框架(如 VideoComposer 等)形成鲜明对比,不仅大幅降低显存占用和推理延迟,还保持了对复杂非刚性编辑的鲁棒性,为视频生成模型的实用化部署扫除了关键效率障碍。
  • 通过用多模态大语言模型(MLLM)替代标准文本编码器,并借助 Deepstack 注入机制将 MLLM 多层特征与 Diffusion Transformer 对齐,LoomVideo 仅用 5B 参数就在视频生成和编辑任务上达到与 13B+ 模型相仿甚至更优的性能。这表明,在统一多模态条件下,精细的特征融合策略可比单纯扩大模型规模更有效地提升能力,为未来资源受限场景下的视频基础模型设计提供了新范式。

方法

LoomVideo 的方法围绕统一视频生成与编辑展开,以多模态大语言模型 (MLLM) 为核心替代传统文本编码器,通过零开销条件化机制紧凑的 DiT 主干实现高效推理。

输入与编码

模型接收交错的多模态输入(文本、图像或视频),首先由冻结的 MLLM 编码为多层级语义特征。这些特征不仅包含全局文本描述,还整合了视觉上下文,为后续生成/编辑提供丰富指导。

关键模块:Deepstack 注入与 DiT

  • Deepstack 注入:不同于简单将 MLLM 最后一层特征注入扩散模型,LoomVideo 将 MLLM 各层输出通过可学习的投影层对齐到Diffusion Transformer (DiT) 的对应层中。该设计让 DiT 的各个注意力层都能利用不同粒度的语义信息,增强模态融合。
  • Zero-overhead Scale-and-Add 条件化:针对视频编辑,传统统一框架通常将源视频 token 与噪声目标 token 拼接,导致自注意力序列长度翻倍、计算量增至 4 倍。LoomVideo 采用一种优雅的替代方案:将干净的源视频潜变量 x0 按固定尺度缩放后,直接加到带噪目标潜变量 zt 上,作为去噪网络的附加输入。该操作不引入任何额外 token,完全消除了自注意力的计算膨胀,堪称“零开销”。
  • Negative Temporal RoPE:为支持多个参考图像且保持时序一致性,模型在时间轴上应用负向旋转位置编码,使网络能区分不同参考帧的时间顺序并避免运动混淆。

训练与输出

模型以扩散损失联合训练生成和编辑任务。推理时,无论输入是纯文本、图像还是视频,DiT 均基于 MLLM 特征和条件化潜变量逐步去噪,输出连贯视频。

与同类方法的差异:现有统一模型(如 Show-1、VideoCrafter)多依赖 13B+ 参数规模和 token 拼接,计算开销巨大;LoomVideo 仅用 5B 参数,借由 Scale-and-Add 条件化和 Deepstack 注入,在保持竞争力的同时,实现了 至少 5.41 倍 推理加速,特别在电商/时尚场景中性能突出,为实用化视频基础模型提供了新范式。

实验

实验设计

评估覆盖视频生成视频编辑两大任务,基线包括基于 13B 参数以上的统一框架。编辑场景中,源视频条件通过拼接序列 token 引入,导致自注意力计算量四倍增长;LoomVideo 则采用零开销 Scale-and-Add 条件,直接缩放并叠加干净源视频潜变量,避免 token 拼接。同时引入负时序 RoPE 处理多参考图像生成。基准测试包含通用视频生成数据集及专为电商、时尚生成定制的评测,兼顾客观指标与人类评估。

关键发现

  1. 性能与效率突破:在 5B 紧凑参数下,模型在多个基准上达到** SOTA 或极具竞争力的结果,推理速度提升至少 5.41 倍**,大幅降低计算开销。
  2. 编辑质量:Scale-and-Add 机制不仅能处理非刚性编辑,还消除了序列长度加倍带来的代价,在复杂场景下保持鲁棒性。
  3. 多模态对齐:通过 Deepstack Injection 将多层 MLLM 特征注入 DiT,替代传统文本编码器,增强了图文语义一致性。

与基线对比的深度解读

传统统一模型(13B+)在视频编辑时直接拼接源视频 token,使 Self-Attention 计算复杂度与序列长度平方成正比,成为推理瓶颈。LoomVideo 的零开销条件设计从数学上解除了这一依赖,仅通过潜变量层面的加性操作注入源视频信息,既保留了编辑能力,又避免了指数级的计算膨胀。实验表明,即使参数规模仅为竞争对手的 1/3~1/2,LoomVideo 在通用视频生成质量和电商/时尚垂直领域仍取得领先,印证了 轻量但高效的可控生成架构的可行性。这一缩放律有别于盲目堆叠模型的趋势,为实际部署提供了更低延迟、更低成本的方案。

行业影响

落地场景

LoomVideo 作为参数仅 5B 的统一视频生成与编辑模型,可直接嵌入短视频创作平台电商内容生产工具影视后期辅助等产品中。其支持交错多模态输入(文本 + 图像 + 视频)与零开销条件注入,尤其适合需要频繁迭代编辑的场景:例如在 电商服装展示 中,只需一张模特图像与多元服饰参考图,即可生成多角度动态试穿视频,且编辑过程可保持非刚性形变(如布料飘动)的真实感。在 社交媒体滤镜/特效引擎 中,用户可上传多张参考图像,快速生成风格化视频,且支持对局部元素(如发色、背景)实时编辑。

商业价值

  • 成本侧:推理速度较同类模型提升 5.41 倍以上,意味着同样硬件资源下可支撑数倍并发请求,直接降低 GPU 服务成本;对于需要实时或近实时响应的 C 端产品,延迟的减少显著提升用户体验与留存。
  • 效率侧:编辑过程无需每次重新生成整个视频,通过 Scale-and-Add 方式可直接在潜在空间注入干净源条件,使产品迭代周期(A/B 测试、风格调整)大幅缩短。
  • 体验侧:面对多参考图像与复杂编辑指令时的稳定性,使得非专业用户也能获得高质量输出,扩大了潜在付费用户群。

与现有产品/工作流的接口

该模型基于扩散 Transformer(DiT),并采用 Deepstack 注入将多模态大语言模型(MLLM)特征对齐到生成主干。集成时可复用现有 DiT 推理管线(如 diffusers 框架),仅需替换特征提取器与条件注入模块。其编辑模式更是一种即插即用的升级:

  • API 设计:输入可统一为 {“prompt”: text, “source_video”: latent, “reference_images”: [imgs]},输出为目标视频的潜在表示,解码后即可交付。
  • 工作流整合:支持 ComfyUI 节点封装,通过 LoadLoomVideo → ConditionEmbed → KSampler 的标准链路快速接入专业创作流。
  • 与现有工具协同:Scale-and-Add 机制天然支持与 ControlNet、IP-Adapter 等即插即用条件扩展结合,只需在噪声目标上叠加缩放后的源潜变量,无需修改自注意力计算图。

具体落地用例

1. 电商视频广告自动生成 输入商品图片与模特图像,系统自动生成 360° 旋转展示视频;运营人员可通过文本指令修改背景、模特姿势或特定面料纹理,无需重新录制,每次修改仅需几秒推理时间。这使中小型商家能以接近零的边际成本生产个性化广告素材,提升转化率。

2. 在线教育场景的交互式课件 教师在录制讲解视频后,可通过 LoomVideo 在视频中实时替换展示的幻灯片、图表或模型,并保持教师动作的连贯性。基于 Negative Temporal RoPE 处理多参考帧的能力,甚至可以将不同实验步骤的图像合成到一个连贯操作视频中,提升课件的专业度与制作效率。

局限

  • **Scale-and-Add 条件化** 假设干净源视频与带噪目标潜在变量可直接通过缩放叠加实现编辑,虽消除序列拼接开销,但忽略了复杂非线性编辑(如大角度旋转、大范围遮挡)中两者之间的高阶交互,可能在极端的非刚性变换下引入模糊或纹理错位,编辑保真度弱于显式注意力融合的方案。
  • **Deepstack 注入机制** 将 MLLM 多层特征固定地注入 DiT 的特定层,未对注入层进行动态选择或自适应权重学习,当输入多模态指令的语义层次差异较大时(如细粒度文本描述配合粗粒度图像引导),可能无法精确对齐跨模态特征,限制了复杂混合指令的理解与生成质量。
  • 模型**5B 参数**虽显著小于主流 13B+ 统一框架,但训练所需的多阶段多模态对齐数据及计算开销未详细披露,实际训练成本与同规模模型的对比不明确;在电商/时尚垂直领域表现突出,但在自然场景、长视频等开放域上的泛化性缺乏系统性验证,且对多参考图像的 Negative Temporal RoPE 策略仅在简单多图场景测试,复杂多图时序一致性有待检验。
论文Jianzong Wu2026-06-04原文

相关内容