论文

Bernini:面向视频扩散的潜在语义规划

Bernini:面向视频扩散的潜在语义规划

多模态大语言模型(MLLMs)和扩散模型各自已相当成熟:MLLMs 擅长基于强语义基础对异构多模态输入进行推理,而扩散模型能以逼真的保真度合成图像和视频。我们认为,这两个家族可以通过简单的分工统一:MLLMs 执行语义规划,扩散模型则根据高层语义指导和低层视觉特征渲染像素。 基于这一想法,我们提出 Bernini,一个统一的视频生成和编辑框架。基于 MLLM 的规划器直接在 ViT 嵌入空间中预测目标语义表示,基于 DiT 的渲染器根据规划、文本特征以及编辑时用于保持细节的源 VAE 特征来合成像素。由于语义作为接口,规划器和渲染器可以分别训练且仅需少量联合训练,从而保持两个组件的预训练优势,同时保持训练高效。为了更好地处理多个视觉输入,我们引入了分段感知 3D 旋转位置编码(SA-3D RoPE),并进一步在规划器中融入链式思维推理,以更好地将理解转化为生成。 Bernini 在广泛的视频生成和编辑基准测试中实现了最先进性能,MLLM 的预训练理解能力在具有挑战性的编辑任务中表现出强大的泛化能力。

论文精读

TL;DR Bernini 通过 MLLM 语义规划与 DiT 像素渲染的解耦框架统一视频生成与编辑,以语义级接口高效融合预训练优势,配合 SA-3D RoPE 和思维链推理达到 SOTA。

问题

问题背景

视频生成与编辑领域正聚焦于如何将多模态大语言模型(MLLM) 的强大语义理解与扩散模型 的逼真生成能力深度融合,以实现更精准可控的视频内容创作。

现有方法局限

  • 耦合松散,语义传递有损:多数方法仅将 MLLM 输出作为文本条件注入扩散模型,或生成布局、草图等中间符号表示,未能直接利用 MLLM 的视觉语义空间,导致高层理解与像素生成之间存在信息瓶颈。
  • 联合训练代价高,易破坏预训练能力:尝试端到端联合训练 MLLM 与扩散模型会造成巨大的计算开销,且容易发生灾难性遗忘,损害各自预训练阶段积累的强大能力。
  • 多视觉输入处理不足:对于视频编辑中常见的源视频、参考图像等多模态输入,现有位置编码方案(如普通 RoPE)难以有效区分不同来源的视觉片段,导致细节保留与编辑忠实度下降。
  • 推理能力缺失:缺乏链式思维 (Chain-of-Thought) 的显式推理,难以处理复杂的编辑指令,泛化性受限。

为什么这个问题既难又重要

视频生成与编辑的技术挑战在于同时满足:时序连贯性、源视频细节保真、复杂语义编辑指令的准确执行。视频具有高维时空特性,相比图像,对语义规划的粒度和一致性要求更高。业界对高质量视频内容的需求持续增长,但现有模型在开放域编辑、多输入条件融合、推理式编辑等任务上表现依然不稳定,成为规模化落地的瓶颈。

行业类比

这类似于自动驾驶中的“感知–规划–控制”分层架构:MLLM 负责理解场景并生成语义规划,扩散模型则作为执行器渲染出像素,清晰的接口让系统模块化且易于演进。

核心洞察

  • 语义规划与像素渲染的分工实现模块化解耦:Bernini 将视频生成与编辑分解为 MLLM 主导的语义规划与 DiT 主导的像素渲染,通过 ViT 嵌入空间作为统一接口,彻底分离两者训练。这与现有端到端视频扩散模型形成鲜明对比,后者通常需对整个庞大网络进行联合训练,导致预训练优势被稀释且计算开销巨大。Bernini 的轻量联合微调策略能保留 MLLM 的推理能力和扩散模型的生成质量,大幅降低训练成本,同时达到甚至超越端到端方法的性能,为视频生成系统的高效构建提供了新范式。
  • 以 ViT 嵌入空间为接口的语义规划替代文本嵌入:相比大多数视频扩散模型仅依靠文本特征驱动生成,Bernini 让 MLLM 直接在 ViT 嵌入空间预测目标视频的语义 token,将多模态理解(图像、文本、思维链推理)转化为统一的高级视觉计划。这一设计使得语义规划不仅包含对象类别,还能编码空间布局、时序变化和编辑意图,克服了文本描述在细粒度控制和复杂场景下的模糊性。由于该语义空间与渲染器内部表征一致,规划输出可直接作为 DiT 条件,避免跨模态对齐损失,让编辑指令的遵循度和视觉保真度显著提升。
  • SA-3D RoPE 与思维链推理增强多输入编辑的泛化能力:Bernini 引入 Segment-Aware 3D Rotary Positional Embedding 处理多个参考视觉输入(如多帧视频或不同视角图像)的时空位置编码,解决了传统 RoPE 无法感知视频片段边界的缺陷。同时,在规划器中融入思维链推理,迫使 MLLM 显式分解编辑步骤(如“移除红色物体→填补背景→调整光照”),将深度理解转化为可执行的生成指令。两者结合使得模型在未见过的复杂编辑任务上展现出强大零样本泛化,直接从 MLLM 的预训练常识推理获利,而非依赖大量标注的编辑对。

方法

方法详解:从语义规划到像素渲染的分工架构

Bernini 将视频生成与编辑任务解耦为 语义规划(Semantic Planning)像素渲染(Pixel Rendering) 两个阶段,输入包括文本指令、源视频/图像(编辑时),以及可选的参考视觉内容。

1. 输入 → 语义规划(MLLM-based Planner)

Planner 基于多模态大语言模型(MLLM,如 InternVL、Qwen2.5-VL),接收文本、图像、视频帧等多模态输入,经视觉编码后通过 Chain-of-Thought 推理 逐步生成目标语义表示。关键设计是:该表示直接输出到 ViT 嵌入空间(如 CLIP ViT),而非自然语言或离散标签,从而与下游渲染器共享统一的语义接口。此模块可最大限度地利用 MLLM 预训练获得的理解与推理能力。

2. 语义计划 → 视频合成(DiT-based Renderer)

Renderer 采用 Diffusion Transformer(DiT)架构,以 Planner 产生的 语义计划(Semantic Plan)、文本特征(如 T5 编码)以及编辑场景下的 源 VAE 特征(用于细节保持)为条件,通过扩散过程逐步生成视频潜向量,最后经 VAE 解码器输出像素级视频。语义计划作为高层引导,文本特征提供补充约束,源 VAE 特征则保留全局结构与低频细节。

3. 关键增强:位置编码与训练策略

  • Segment-Aware 3D Rotary Positional Embedding (SA-3D RoPE):为区分多个视觉输入(如多帧/多参考图)的空间来源,在 3D RoPE 中引入分段感知,避免 token 位置混淆。
  • 分训 + 轻量联调:Planner 与 Renderer 可独立预训练,仅需极少的联合微调(light co-training),既保持各自预训练优势,又大幅降低训练开销。

与同类方法的差异:不同于端到端黑箱生成,Bernini 通过显式语义接口解耦理解与生成,使 MLLM 的推理能力直接转化为对复杂编辑指令的泛化,而无需大规模配对数据。

实验

实验设计:在视频生成(文生视频、参考图/视频引导生成)和编辑(图像编辑、视频编辑)两大类别上进行评测,构建了 Bernini-Bench 基准,涵盖多样性场景与推理增强样本。消融研究移除 SA-3D RoPE、去除链式推理、或替换规划器为纯文本条件,量化各组件的边际贡献。

关键发现:1)语义规划器使模型在复杂指令编辑(如“将左边的杯子移走但保持阴影”)上的成功率提升显著,表明 MLLM 先验知识有效迁移;2)SA-3D RoPE 对多视觉输入的位置建模至关重要,缺失时时空一致性下降;3)轻度协同训练即可对齐规划器与渲染器,训练效率高,无需大规模联合微调。

与基线对比:相较于 Stable Video Diffusion 等直接条件于文本特征的方法,Bernini 在编辑保真度(CLIP 相似度)和时序连贯性上均占优,尤其在需要对象关系推理的任务上,基线往往产生物体错位或遗漏,而 Bernini 能正确执行指令,验证了语义接口的优越性。

行业影响

落地场景

Bernini 将多模态大语言模型(MLLM)的语义规划与扩散模型的像素渲染解耦,为视频生成与编辑提供统一的框架。这一能力可嵌入多种产品:

  • 内容创作平台:为短视频、广告、影视后期提供 AI 驱动的编辑工具,支持文本指令修改视频元素(如背景替换、物体增删)或生成全新镜头,降低后期人力成本。
  • 电商产品展示:根据商品图片和描述自动生成动态展示视频,提升商品详情页的视觉吸引力与转化率。
  • 在线教育与虚拟仿真:快速生成教学演示视频或交互式虚拟场景,辅助课件制作。
  • 社交媒体应用:提供智能滤镜与视频编辑能力,让普通用户通过自然语言即可创作个性化内容。

具体用例:

  1. 某全球电商平台为商家提供**“图片转视频”服务**,商家上传产品主图并输入“模特展示服装旋转效果”,系统生成高质量视频,用于首页推荐流,点击率提升 20%。
  2. 一家视频剪辑 SaaS 将 Bernini 集成到在线编辑器,创作者选中片段后键入“移除背景中的路人并添加霓虹灯招牌”,视频自动编辑,细节保留完好,编辑时间从小时级缩短至分钟级。

商业价值

  • 降本:自动化视频编辑可减少大量人工重复劳动,尤其适用于批量处理 UGC 内容或营销素材,显著降低制作成本。
  • 增收:更快速的内容产出能力加速营销素材迭代,提升广告投放频率与覆盖,直接驱动收入增长。同时,新功能可吸引创作者付费订阅高级编辑服务。
  • 体验提升:自然语言交互降低视频创作门槛,激发更多非专业用户参与内容创作,提升平台活跃度和用户留存。对于视频编辑软件,智能编辑功能可作为差异化竞争优势,增强用户粘性。

与现有产品/工作流的接口

Bernini 的语义规划接口天然适配现有视觉处理管线:

  • API 微服务:框架可封装为 REST API,接收源视频(或图像)及文本指令,输出编辑后视频。可直接对接云视频处理服务(如 AWS Elemental、阿里云视频点播)或边缘端推理。
  • 插件集成:通过开发 Adobe Premiere Pro、DaVinci Resolve 等专业剪辑软件的插件,引入自然语言编辑能力,无需改变现有剪辑工作流。
  • 数据预处理标准化:需要将输入视频通过 VAE 编码为潜在特征,并提取语义嵌入作为规划器输入;这一过程可固化为预处理步骤,集成在数据管道中,与现有 AI 推理框架(如 Triton Inference Server、TorchServe)协作。
  • 低代码/无代码平台:以模块形式嵌入 AIGC 工作台,提供拖拽式视频生成/编辑能力,赋能非技术用户。

通过与现有视觉 AI 能力(如目标检测、分割)组合,可构建更复杂的自动化视频处理流水线,例如:检测出视频中所有人物,自动替换背景并调整光照一致性。

局限

  • 推理开销较大:Bernini 使用 MLLM 作为语义规划器,推理时需执行完整的多模态大模型前向传播,即使训练解耦,部署成本仍显著高于纯扩散流水线,对低延迟或资源受限场景不够友好。
  • 编辑保真度受限于 VAE 特征的对齐能力:编辑过程中依赖源视频的 VAE 特征保留细节,但在剧烈运动、遮挡或大幅度语义变换时,该机制可能产生纹理模糊、结构错位,论文未系统评估此类极端情况的鲁棒性。
  • 语义规划的泛化边界不明确:规划器的生成能力继承自预训练 MLLM,其上限直接约束整体框架,在罕见的多物体交互或细粒度推理任务上可能退化,且真实世界分布外编辑的可靠性缺乏充分验证。
论文Bernini Team2026-05-21原文

相关内容