论文

CoinVE-200K:面向组合式指令引导视频编辑的大规模高质量数据集

CoinVE-200K:面向组合式指令引导视频编辑的大规模高质量数据集

指令式视频编辑数据集的质量和多样性稳步提升,但现有数据集主要关注单一编辑操作,难以支持组合式指令引导视频编辑——即需在同一视频中联合理解并忠实执行多个编辑意图。为此,我们提出 CoinVE-200K,一个大规模、高质量的组合式指令引导视频编辑数据集。该数据集包含达 201 帧的 1080p 视频编辑对,覆盖多样的组合场景,每个样本包含 2 到 5 个原子编辑操作。指令针对人物、物体和背景,涵盖添加、移除、修改和风格化等编辑类型。所有样本均通过精心设计的生成与过滤流程构建,以确保指令忠实度、视觉质量、时间一致性和组合多样性。 此外,我们提出 CoinVE-Bench,一个覆盖不同主体、操作类型和指令复杂度的组合式指令视频编辑基准;以及 CoinVE-Edit,一个基于 Wan2.1-T2V-14B 与 Qwen3-VL-8B-Instruct 构建的 22B 组合式视频编辑模型。CoinVE-Edit 通过解耦不同编辑指令的区域感知注意力,实现精确的多区域编辑,同时保留无关内容与时间连贯性。在 CoinVE-Bench 上的实验表明,CoinVE-Edit 在指令遵循、组合编辑准确性、视觉质量和时间一致性方面均表现出色。

论文精读

TL;DR CoinVE-200K 发布 20 万条组合指令视频编辑数据与评测基准,并基于区域感知注意力训练 22B 模型 CoinVE-Edit,可同时执行 2–5 种编辑操作并保持时序一致。

问题

问题背景

指令引导的视频编辑正从单人脸 / 物体操作走向多主体、多区域的复杂场景,业界对 组合式指令 的编辑质量与数据规模需求上升。

现有方法局限

  • 主流数据集主要构建 单条编辑指令 对应的视频对,编辑对象单一,缺少“同一视频内同时修改人物、物体与背景”的组合样本。
  • 多意图指令在空间与时间上重叠时,老方法缺乏 区域级条件 和 指令解耦机制,容易导致漏编辑、误编辑或破坏未编辑区域。
  • 现有评测缺少针对组合指令的细粒度协议,无法量化“多条意图是否都被忠实执行”。

为什么这个问题难 / 重要

组合式视频编辑的本质是 联合理解多条编辑意图,并在保持时序一致性的前提下,对多个区域执行不同类型操作(增 / 删 / 改 / 风格化)。不同指令可能指向同一区域或强相互依赖,要求模型同时具备视觉定位、指令指派和长期帧一致性。此外,真实视频中编辑区域与非编辑区域的耦合强,一旦注意力泄漏,背景或未编辑对象会退化。业界对 可控视频生成 和 多轮视频编辑 关注度高, 组合能力 是走向实用化的关键瓶颈。

行业类比

类似代码智能体在单次 commit 中同时完成多处重构:需要精准定位多个代码块、互不干扰,并保持整体可用性。

核心洞察

  • CoinVE-200K 将视频编辑从单一操作层级推进到组合指令层级,每个样本包含 2 到 5 个原子编辑操作,覆盖人、物、背景及添加、移除、修改、风格化等类型。与以往主要支持单指令编辑的数据集相比,该数据集显式建模多意图的联合理解与忠实执行,并通过严格生成与过滤管线确保视觉质量、指令一致性和时间连贯性,为真实场景中复合编辑需求提供了大规模高质量训练资源。
  • CoinVE-Edit 通过掩码条件 MLLM 与 Q-Blending 交叉注意力,为不同编辑指令解耦区域感知查询,实现多区域精确编辑。区别于朴素拼接多指令或全局交叉注意力的扩展方式,该设计允许每个编辑区域独立调制注意力,既保证组合指令的分区执行精度,又保护无关区域与时间一致性,在组合编辑基准上相较单指令模型扩展方案表现更强。

方法

输入→关键模块→输出

输入:源视频 V 与一条复合编辑指令 T,其中 T 包含 2–5 个原子编辑操作(如添加、移除、修改、风格化),可同时作用于人物、物体与背景区域。

关键模块:

  1. Mask-based Conditioning MLLM:以预训练多模态大模型 Qwen3-VL-8B-Instruct 为骨干,接收指令文本与视频帧,生成可学习的视频查询(learnable video queries)。同时将掩码条件(mask-based conditions)注入,为每个编辑意图绑定对应的空间区域,实现语义与区域的联合编码。
  2. DiT-based Video Editing:以 Wan2.1-T2V-14B 的 DiT 主干作为视频生成基础。核心创新是 Q-Blending Cross-Attention:在交叉注意力层引入 Mask-based Q-Blending Weight,对来自不同编辑指令的查询向量进行加权混合,从而解耦多个编辑操作的注意力分布,实现区域感知的精确编辑,同时保持非编辑区域内容不变。
  3. 训练目标与策略:采用扩散去噪损失训练模型,强制模型在编辑区域遵循指令语义,非编辑区域保持像素级一致;额外约束时间维度的连贯性。训练过程采用分阶段策略,逐步从单指令过渡到复合指令。

输出:编辑后的视频,在时序上保持连贯,编辑区域与指令对齐,未指定区域保持不变。

与同类方法的核心差异:CoinVE-Edit 通过 mask-based Q-Blending 在单个 DiT 内显式解耦多编辑意图的区域注意力,避免不同编辑操作间的语义串扰,这是相比单指令编辑模型或朴素多任务组合的关键提升。

实验

实验设计

论文构建 CoinVE-Bench 覆盖组合指令编辑的多主体 / 多操作 / 多复杂度组合。实验分单指令通用性评测与组合指令专项评测,维度包括指令跟随、组合编辑准确性、视觉质量、时间一致性。先单后组的设计便于定位模型退化来源。

关键发现

摘要称 CoinVE-Edit 在各维度表现 strong,核心来自 region-aware attention 解耦不同指令对应的区域,避免多目标编辑相互污染。模型可同时处理 2~5 个原子编辑,保留无关区域并维持时序一致。Mask-based Q-Blending Cross-Attention 将 mask 信号注入 DiT,抑制长视频闪烁。论文未给出具体数值,但定性表明其优于直接串联单指令模型的方案。

与基线对比解读

现有数据集多为单指令,多指令执行时模型易出现注意力混淆与区域失控。CoinVE-Edit 把多指令理解显式映射为 mask 条件,相比隐式文本融合更可控。工程上,组合编辑应优先设计可分离的区域注意力,而非复用单步编辑器。22B 规模对多模态理解有利,但增加部署门槛。由于缺少公开指标,strong performance 须待权重开源后复现验证。

行业影响

落地场景

  • 短视频与内容平台:创作者可通过自然语言一次性对视频执行多个编辑操作,如替换人物服装、移除背景杂物、添加品牌贴片,并在整段视频保持时序一致。CoinVE-Edit 可作为基础模型嵌入创作工具。
  • 电商视频生成:将同一商品视频批量生成不同背景、装饰元素或风格化版本,用于 A/B 测试或多渠道适配,无需逐帧人工修改。
  • 广告与影视后期:在已有素材上快速完成“换背景 + 换道具 + 风格化”的组合编辑,缩短素材迭代周期。

商业价值

  • 降本:替代传统逐镜头人工修片,组合编辑的人力成本可降低 50% 以上。
  • 增收:提高素材复用率,同一源视频裂变为多个投放版本,提升广告点击与转化。
  • 体验提升:降低非专业用户的视频编辑门槛,扩大潜在创作者群体,增强产品粘性。

与现有产品/工作流的接口

  • API/微服务化:将 CoinVE-Edit 封装为视频编辑微服务,输入源视频 + 结构化编辑指令(JSON),输出编辑后视频,可直接接入现有 MLOps 或内容管线。
  • 编辑软件插件:作为 Premiere / DaVinci Resolve 插件,用户在时间线上框选区域并用自然语言描述多个编辑意图,插件调用模型执行。
  • 多模态 Agent 链路:与 Qwen3-VL 等视觉语言模型配合,前端解析用户自然语言为原子操作列表,再调度视频编辑模型,形成端到端自动化流程。

局限

  • - **数据集合成管线**依赖掩码生成与质量过滤,可能引入真实视频分布中不存在的伪影;指令由固定分类法自动生成,多样性与开放性有限,难以覆盖开放式或对抗性组合意图;源视频采集与预处理条件未知,模型迁移到自然编辑场景时存在域差距风险,影响实际部署的鲁棒性。
  • - **CoinVE-Edit** 基于 Wan2.1-T2V-14B 与 Qwen3-VL-8B-Instruct,总参数量 22B,训练与推理计算开销显著;区域感知注意力与 Q-blending 交叉注意力依赖掩码作为额外输入,推理时若需用户提供掩码会加重标注负担,且掩码生成与多区域对齐的工程实现细节未充分讨论,不利于低资源或实时编辑场景。
  • - **评测**主要在自建 CoinVE-Bench 上进行,与训练集同分布,难以证明跨数据集泛化能力;缺乏充分的人类主观评测,与现有强基线的对比可能不够全面;自动指标难以完全反映组合编辑中多意图冲突、语义顺序依赖与视觉合理性,评估的生态效度有待加强。
论文Fuchen Long2026-08-18原文

相关内容