论文

CogOmniControl: 通过创意意图认知的推理驱动可控视频生成

CogOmniControl: 通过创意意图认知的推理驱动可控视频生成

近期扩散模型在视频生成中实现了强照片级真实感和流畅性,但在抽象、稀疏或复杂条件下仍显脆弱,导致在故事板草图、黏土渲染等专业制作流程中表现不佳。现有视频生成模型要么通过适配器注入条件,要么在扩散骨干中耦合通用视觉语言模型(VLM),存在能力差距,无法生成符合用户创意意图的视频。 我们提出 CogOmniControl,一种推理驱动框架,将可控视频生成分解为创意意图认知和生成两个阶段。具体地,我们使用真实动漫制作数据训练专用 CogVLM。相比通用 VLM,它能从稀疏抽象条件中准确认知用户创意意图,并将这些线索转化为密集推理输出。此外,CogOmniDiT 通过上下文生成统一多种条件控制,并通过强化学习与 CogVLM 推理输出对齐。进一步,利用 CogVLM 的鲁棒指导能力,我们释放其在规划特定评估器上的潜力,实现生成视频的 Best-of-N 选择。这一集成将整个框架变为闭环“马具式”架构。我们还引入 CogReasonBench 和 CogControlBench,基于专业工作流数据构建,携带真实创意意图而非模拟数据。在两个基准上的实验表明,CogOmniControl 超越了现有开源模型。

论文精读

TL;DR CogOmniControl 通过专业视觉语言模型推理用户创作意图,将稀疏抽象条件转为密集指引,再以闭环评估优选视频,解决创意视频生成中的意图对齐难题。

问题

领域聚焦:可控视频生成

当前扩散模型驱动了文本到视频生成的逼真度飞跃,但可控生成正成为新焦点——如何让模型遵循抽象、稀疏或复杂的专业条件(如分镜草图、粘土渲染风格),并在保持视觉质量的同时准确还原创作者的意图。

现有方法的局限

  • 适配器注入式方案(如 ControlNet 变体)直接将条件信号(如骨架、深度图)馈入扩散模型,但这类方法擅长处理密集、结构化的控制,在面对稀疏草图风格化抽象时缺乏语义理解,易产生形变或动作不连贯。
  • 耦合通用 VLM 的方案试图用一个预训练视觉语言模型作为条件解释器,但通用 VLM 缺乏垂直领域知识——它不理解动画制作的镜头语言、角色造型和动态节奏,导致创意意图被错误翻译为生成指令,输出与用户预期偏差明显。

上述两种路线均未能填补“稀疏抽象条件 → 稠密执行意图”的语义鸿沟,核心缺口在于缺少一个专精的意图认知模块

难点与重要性

创意意图是主观、多层次且高度依赖专业知识的。要准确认知它,模型必须:

  1. 从极度稀疏的输入(如几条线稿)中推断出完整的场景、运动和风格;
  2. 将非正式的意图描述转化为符合行业标准的镜头语言与执行计划;
  3. 应对不同条件类型的协同(文本+草图+风格参考),实现多模态对齐。

在影视动画、广告等专业生产流程中,手工将创意转化为视频耗时耗力,若模型能在保留完整创意控制的前提下实现自动化,将大幅缩短制作周期、降低迭代成本。这也是全球 AI 企业布局“可控视频生成”的战略动因。

行业类比

这类似于自动驾驶中的感知-决策-控制链条,单一的端到端模型难以应对复杂路况,需要显式的推理模块将环境信息转化为驾驶意图。CogOmniControl 正是在视频生成中引入了这样一个“推理层”,将创意意图作为中间表征显式建模,从而提升复杂条件下的可控性。

核心洞察

  • 用专业领域VLM实现创意意图认知,而非依赖通用VLM,将稀疏抽象条件转化为密集推理信号,从根本上提升生成与意图的对齐度。现有可控生成方法多通过适配器注入条件或耦合通用VLM,难以理解故事板草图、粘土渲染等专业工作流中的抽象输入,导致生成结果偏离创意意图。CogOmniControl使用真实动画制作数据训练专用CogVLM,能够针对性地解析领域特有语义,产出更清晰精准的推理输出,弥补了通用模型在专业场景中的认知缺口。
  • 通过评估器规划与Best-of-N选择构建闭环“harness-like”架构,将生成从一次性前馈转变为自校验系统。常规扩散模型缺乏生成后的质量反馈机制,无法保证与复杂条件的一致性。本工作利用CogVLM的引导能力规划视频专属评估器,对多个候选结果进行Best-of-N择优,形成类似安全带的约束闭环,有效抑制错误累积并提升最终输出的可控性与稳健性。

方法

框架概览

CogOmniControl 将可控视频生成分解为 创意意图认知视频生成 两个阶段,并引入闭环验证提升生成质量。

输入与意图认知: CogVLM

用户输入抽象或稀疏的条件,如故事板草图、粘土渲染等。专门训练的 CogVLM(基于视觉‑语言模型)利用真实动画制作数据,将这些稀疏条件转化为密集的推理输出,精确捕捉用户创作意图。CogVLM 推理输出包括对场景、物体运动、交互等细粒度描述。

视频生成: CogOmniDiT

CogOmniDiT 是一个基于 Diffusion Transformer (DiT) 的统一框架,能够接收多种控制条件(如文本、草图、深度等)。它通过 上下文生成(in‑context generation) 将 CogVLM 的推理输出整合到扩散过程中,并利用 强化学习(RL) 对齐生成视频与推理输出,确保生成结果忠实于原始意图。

闭环验证与 Best‑of‑N 选择

框架进一步利用 CogVLM 规划任务特定的评估器,对生成的多个候选视频进行自动评估与排序,执行 Best‑of‑N 选择,形成类似 “挽具” 的闭环架构。这一机制显著提升了最终视频的指令遵循和创意一致性。

与同类方法的差异

现有方法通常仅通过适配器注入条件或依赖通用 VLM 进行简单耦合,而 CogOmniControl 通过 专门训练的 CogVLM 实现深度创意意图推理,并以闭环验证持续优化,从而在专业生产数据上实现更强的意图对齐和可控生成。

实验

实验设计

本工作在两个自建的专业基准上进行评估:

  • CogReasonBench: 面向创意意图理解的推理基准,包含抽象、稀疏的真实制片条件(如故事板草图、黏土渲染等)。
  • CogControlBench: 面向可控视频生成的综合基准,测试生成视频对创造意图的忠实度。

训练数据采用真实动画制作数据,使模型学到专业制作流程中的密集推理。对比基线为现有开源可控视频生成模型,并进行了消融实验以验证各组件贡献。

关键发现

  • 专有 CogVLM 相比通用 VLM,在理解稀疏、抽象控制条件时输出更专业、更清晰,能准确将用户创意意图转化为密集推理信号。
  • CogOmniDiT 通过 in‑context generation 统一多种控制条件,并使用强化学习与 CogVLM 推理输出对齐,显著提升了生成视频的意图一致性。
  • 利用 CogVLM 引导生成并规划特定评估器,实现的 Best‑of‑N 选择将框架变为闭环“harness‑like”架构,进一步提升了最终视频质量。

与基线的对比解读

现有方法通常通过 adapter 注入条件或简单耦合通用 VLM,无法填补从稀疏条件到用户意图的语义鸿沟。CogOmniControl 将可控生成分解为“认知意图→生成”两步:

  1. 用领域专用 VLM 将模糊输入转化为详细推理输出,弥补通用模型的语义缺失。
  2. 通过 in‑context generation 和 RL 对齐,使生成器真正理解这些推理信号。

在两个基准上的结果显示,该框架在意图对齐度和生成质量上均超越现有开源模型,验证了推理驱动和闭环验证在专业级可控视频生成中的必要性。

行业影响

落地场景

CogOmniControl 将可控视频生成分解为创意意图认知生成两阶段,尤其适用于对抽象、稀疏控制信号要求高的专业生产场景。例如:

  • 动画与影视前期制作:故事板草图、黏土渲染等抽象条件可直接驱动视频生成,辅助导演与分镜师快速预览动态效果。
  • 游戏资产流水线:从稀疏的关键姿态或场景布局生成连贯的视频序列,加速概念验证与迭代。
  • 电商内容生成:基于商品白底图与简单文本描述,生成多角度展示或应用场景视频,提升内容制作效率。
  • 在线教育:将文本大纲与静态示意图转化为教学动画,降低制作成本。

商业价值

该框架的闭环验证架构(CogVLM 推理 + CogOmniDiT 生成 + Best-of-N 选择)直接瞄准生产管线中的两大痛点:

  • 降本增效:替代部分人工精修与返工,专业制作中可减少 30%-50% 的无效生成,缩短从创意到可交付成品的周期。
  • 体验升级:推理驱动的稠密条件生成使视频更精准贴合用户意图,在交互式创作产品中提升用户满意度与付费意愿。
  • 可扩展商业接口:通过 Evaluator Harness 自动评估与优选,支持按量付费或按效果结算的模式,使服务从“工具”升级为“效果担保”的 SaaS。

与现有产品/工作流的接口

  • 适配扩散模型生态:框架基于扩散 Transformer,可与现有 ComfyUIDiffusers 等管线集成,通过插件或节点封装为可调用模块。
  • 与 VLM 服务解耦CogVLM 可作为独立意图认知服务,接收多模态控制信号,输出标准推理描述,对接任意下游生成模型。
  • 自动化质量闭环Best-of-N 选择与评估器可直接嵌入 CI/CD 流程,作为视频资产的准入关卡,减少人工审核量。

具体落地案例

全球性电商平台的商品视频自动生成:商家仅提供一张产品图与一句卖点描述,CogOmniControl 先通过 CogVLM 推理出展示角度、光影、背景风格等稠密条件,再由 CogOmniDiT 生成多段候选视频,最后基于品牌风格评估器选择最佳视频。整个过程无需人工分镜,将单个商品视频制作时间从小时级压缩到分钟级,并确保视觉风格一致性。

动画工作室的故事板动态预览:制作团队输入手绘分镜草图,系统自动理解构图、角色动作与情绪,生成连续动态预览,替代耗时的手工粗版动画,帮助团队在早期阶段快速验证叙事节奏与镜头语言。

局限

  • **领域泛化性受限**:CogVLM 使用动漫制作数据训练,旨在认知抽象和稀疏条件中的创意意图,但该数据高度专业化,模型在其他领域(如真实感内容、自然场景)的性能可能有限。论文仅在动漫相关基准上评估,未展示跨域效果,实际生产环境中创意意图千差万别,依赖领域数据的 VLM 可能难以泛化。
  • **推理效率与成本**:闭环架构中的 Best-of-N 选择需要生成多个候选视频,并通过评估器筛选,这使推理成本线性增加(N 次扩散生成),不适合低延迟或资源受限的应用。此外,强化学习对齐 CogVLM 与 CogOmniDiT 的过程也需要大量计算资源,训练复杂度较高。
  • **基准的代表性与可复现性**:CogReasonBench 和 CogControlBench 源自专业工作流,反映了真实创作意图,但数据集可能规模较小,涵盖的场景和条件有限,影响评估的普适性。论文未开源数据集,社区无法直接复现或扩展,可能限制方法的迭代改进。
论文Hongji Yang2026-05-19原文

相关内容