论文

Goku: 一个百万级通用数据集和基准,用于基于指令的视频编辑

Goku: 一个百万级通用数据集和基准,用于基于指令的视频编辑

现有基于指令的视频编辑数据集通常只关注单任务外观编辑,难以满足真实场景的复杂创作需求。为此,我们提出 Goku,一个包含 200 万高质量、指令对齐的视频编辑对的大规模数据集,首次将任务边界从基础外观编辑扩展到多任务和结构操控(如精确控制主体运动)。 为应对这些复杂任务在数据合成中的挑战,我们设计了一个高效的数据合成管道,将复杂编辑分解为可控子问题,并引入 渐进式过滤系统 以确保全过程的数据可靠性。此外,我们在 Goku 上探索最优网络结构,提出 Goku-Edit。为深入理解复杂编辑指令,Goku-Edit 采用 MLLM 作为文本编码器,并采用 解耦双分支设计:专用 掩码分支 处理结构控制,释放主分支用于 外观渲染。 我们还提出了一个全面的视频编辑基准 Goku-Bench,包含 1000 个人工验证的测试用例和 7 个新颖的 编辑专用指标。在 Goku-Bench 上,Goku-Edit 在指令遵循方面相比其他开源模型取得高达 +8% 的提升。

论文精读

TL;DR Goku 发布首个百万级多任务视频编辑数据集与基准,支持外观与结构操控;配套模型 Goku-Edit 采用 MLLM 与解耦双分支设计,在指令遵循上全面超越开源方案。

问题

问题背景

指令驱动视频编辑 (IVE) 正成为生成式 AI 的热点方向,它允许用户通过自然语言描述对视频内容进行灵活修改,推动数字内容创作从简单的视频生成转向更复杂的后期编辑。

现有方法局限

现有 IVE 数据集(如 InsV2V, InsVIE-1M)几乎全部聚焦于单任务外观编辑(如换色、风格迁移),编辑对之间只涉及颜色、纹理等表层属性的变化。这导致两大技术缺陷:

  • 编辑类型单一:无法处理多任务组合(例如同时改变人物衣着与背景季节)或结构操控(如控制主体运动轨迹),与真实创意需求脱节。
  • 数据合成策略局限:为生成复杂编辑对,直接使用端到端模型容易产生伪影和语义错位,难以保证指令对齐的精度。

技术挑战与重要性

构建能覆盖外观与结构的多任务编辑数据集面临以下核心挑战:

  • 复杂编辑的分解与可控生成:结构编辑(例如“让小狗跑动起来”)需要同时理解空间位移与动作语义,直接将复杂指令映射为像素变化极易失败。
  • 指令遵循与视觉一致性:模型必须精准解析长指令中的多个操作点,并保持视频的时间一致性,任何偏差都会导致不自然的闪烁或变形。
  • 评估体系缺失:现有基准仅用少量人工评价,缺乏针对编辑特异性(如结构保持、运动自然度)的自动化指标,导致模型优化方向模糊。

该问题的重要性源于业界对可控视频生成工具的迫切需求:从影视后期到虚拟现实,都需要能精确响应复杂指令的编辑模型。突破这一瓶颈将显著降低高质量视频内容的创作门槛。

行业类比

类似 InstructPix2Pix 在图像编辑中引入指令跟随范式,但其视频版本需要同时解决时间一致性与多帧结构控制,挑战度类比于自动驾驶中根据自然语言指令实时修改车辆行驶轨迹与场景布局的端到端响应系统

核心洞察

  • Goku-Edit 通过解耦的双分支架构将视频编辑中的结构操控与外观渲染分离开来。传统指令编辑模型通常以单分支同时处理空间结构和像素外观,这导致结构修改时易引入纹理失真,或外观编辑时破坏物体轮廓。Goku-Edit 引入专用的掩码分支负责生成编辑区域的时空掩码,显式控制物体的形状与运动,主分支则专注于纹理和光照渲染。这种设计使得模型能够独立优化两个子任务,在复杂编辑(如移动物体)中显著提升结构一致性和视觉质量,为指令视频编辑的可控性提供了新范式。
  • Goku 提出了一种分解-合成-过滤的数据生成管线,解决了复杂多任务编辑数据难以获取的瓶颈。现有数据集多为简单的单任务外观编辑(如换色、风格化),数据量小且任务单一。Goku 将复杂编辑指令拆解为可独立控制的子问题序列,通过自动化工具链完成初始合成,再经过渐进式多级过滤剔除低质量样本,最终构建出 200 万规模的多任务数据集,覆盖外观、运动等多维度编辑。这种管线具有良好的可扩展性,为训练通用视频编辑模型提供了系统化的数据解决方案,有望被后续工作广泛采用。

方法

模型架构总览

Goku-Edit 面向复杂的指令视频编辑任务,支持外观修改与结构操控(如主体位移、形变)。输入为源视频与编辑指令,输出编辑后视频。

关键模块分解

  1. MLLM 文本编码器

    • 采用多模态大语言模型替代传统 CLIP 文本编码器,深度解析长尾、多属性编辑指令,生成富含语义的空间-时序条件特征。
    • 相比短文本编码,MLLM 能捕捉“将左侧物体移到右侧并改为红色”等复合意图。
  2. 解耦双分支网络

    • 主分支负责外观渲染(颜色、纹理、光照修改),基于扩散模型完成像素生成。
    • Mask 分支专门处理结构控制:根据指令预测时空编辑掩码与运动场,将结构变化从外观生成中解耦。
    • 两者通过 RoPE 对齐的空间交叉注意力(RoPE-Aligned Spatial Cross-Attention)交互:mask 分支输出的结构特征以旋转位置编码注入主分支的注意力层,在保持时序一致性的同时,精准对齐空间编辑区域。
  3. 空间增强分类器自由引导(SpatialCFG)

    • 推理时利用 mask 分支提供的空间先验,动态调制无条件预测的强度,仅在目标区域施加编辑控制,避免背景畸变。

数据与训练

模型在 Goku 数据集上训练,该数据集包含 200 万高质量指令-编辑视频对,覆盖多任务与结构操控,并经过 渐进过滤系统 清洗,确保配对可靠性。训练过程联合优化外观重建与结构对齐损失,使双分支协同收敛。

与同类方法的差异

以往方法(如 InsV2V、AnyV2V)多基于 CLIP 编码单任务外观编辑,难以处理结构变化;Goku-Edit 首次通过 MLLM+解耦双分支将复杂结构操控纳入统一框架,在 Goku-Bench 上指令遵循指标领先开源模型最高达 8%。

实验

实验设计

模型在百万级 Goku 数据集 上训练,该数据集首次覆盖多任务外观编辑与结构操控(如主体运动控制)。评估基于 Goku-Bench,包含 1000 组人工校验测试用例和 7 项编辑专用指标,从指令遵循、区域精度、时序一致性等维度衡量模型能力。基线包括现有开源指令视频编辑方法,对比严格限定在相同测试协议下。

关键发现

  • 指令遵循Goku-Edit 在 Goku-Bench 上较基线最高 +8% 提升。归因于其采用 MLLM 作为文本编码器,能深度解析复杂编辑意图,而非简单关键词匹配。
  • 结构控制:解耦的 mask 分支 专门处理结构级编辑(如位移、姿态变化),使主分支专注外观渲染,大幅减少两类编辑的相互干扰。
  • 定性观察:消融实验表明移除 mask 分支后,运动一致性显著下降;SpatialCFG 等设计进一步提升了局部编辑的准确性。

与基线对比解读

以往方法多限于单任务外观编辑,面对“将人物移到左侧并改为红衣”这类复合指令时易出现属性混淆或运动模糊。Goku-Edit 通过 双分支解耦架构 与空间增强引导,显式分离“在哪里改结构”和“改什么外观”,有效抑制了编辑目标间的特征纠缠。相比于端到端统一模型,该设计在需要精确控制主体运动的场景中鲁棒性更强,且便于独立优化各模块,为视频编辑架构演进提供了工程参考。

行业影响

落地场景

Goku 数据集与 Goku-Edit 模型在视频编辑方向的多任务与结构操控能力,可赋能以下业务:

  • 短视频创作平台:支持创作者通过自然语言指令同时修改视频中主体的外观与运动轨迹,降低复杂特效制作门槛。
  • 广告与电商素材生产:批量对商品展示视频进行背景替换、产品移动路径调整,满足多渠道投放的多样化尺寸与动效需求。
  • 影视后期辅助:快速完成粗剪片段的风格迁移、角色动作重定向等重复性工作,加速预演与迭代。

商业价值

  • 降本增效渐进式过滤系统任务分解合成流水线 能自动化生成高质量编辑对,减少人工标注成本;双分支架构中的掩码分支负责结构控制,主分支专注外观渲染,可并行加速推理。
  • 体验升级:基于 MLLM 的文本编码器增强对复杂编辑指令的理解,在 Goku-Bench 上指令遵循指标提升 +8%,直接改善用户操作成功率与内容一致性。
  • 生态扩展:作为首个覆盖结构操控的大规模基准,可吸引开发者基于统一评估体系迭代模型,形成数据飞轮。

与现有产品 / 工作流的接口

集成到现有视频编辑栈时,可考虑:

  • 模型即服务:将 Goku-Edit 封装为 API,上游接入现有内容管理系统的触发任务,下游对接渲染引擎,支持通过 JSON 传入指令与原始视频。
  • 插件化集成:针对 After Effects、Premiere Pro 等专业工具开发面板插件,利用 SpatialCFG 提升局部编辑精度,让剪辑师在交互式界面中调用。
  • 数据循环:将用户修正后的视频自动加入 Goku 框架进行再训练或微调,形成个性化风格模型。

具体落地案例

  1. 电商广告批量生产:卖家上传单一产品视频后,平台可自动生成不同场景(如办公、户外)下产品移动展示的视频变体,并根据不同活动指令(“让产品从左向右滑动并变为红色”)输出对应素材,大幅缩短上新周期。
  2. 在线教育内容制作:课程制作者拍摄教师讲解片段,后续通过指令编辑替换背景为虚拟教室并调整教具动画运动路径,无需专业动效师即可快速产出多语言、多场景的教学视频。

局限

  • **数据合成流水线依赖自动化流程**,尽管设计了渐进式过滤,但复杂编辑(如多任务、结构操控)的生成质量仍可能受限于底层生成模型的保真度,且分解为子问题的策略可能引入误差累积,导致部分编辑对不够自然或指令对齐不完美。这在大规模数据集中难以完全消除,可能影响模型在极端或罕见编辑场景下的表现。
  • **Goku-Edit 模型架构计算开销较大**:采用 MLLM 作为文本编码器和解耦双分支设计,虽提升了指令理解与结构控制能力,但相比单分支轻量级方案,训练和推理效率可能较低。论文未详细讨论推理延迟与资源消耗,这对实时或交互式视频编辑应用构成工程化落地障碍。
  • **基准测试 Goku-Bench 规模有限(仅 1,000 个人工验证样本)且任务覆盖可能存在偏置**:尽管包含了 7 个编辑专项指标,但样本量较小可能影响统计显著性,且任务类型虽扩展至结构操控,仍可能未覆盖如多目标交互、长时序一致性等更复杂挑战,泛化评估性不足。
论文Sen Liang2026-06-30原文

相关内容