论文

GraphVid: 交互式图可控视频生成

GraphVid: 交互式图可控视频生成

可控视频生成仍然具有挑战性,因为使用文本提示或主要约束像素运动的运动控制输入很难精确指定多对象交互。基于轨迹的控制通常需要用户为多个对象绘制准确轨迹,这随着场景复杂性扩展性差,并且在遮挡或重叠下变得模糊。 为了灵活且精确地控制多主体,我们引入 GraphVid,一种基于图的图像到视频生成模型,通过 结构化交互图 实现交互控制。我们还整理了 GraphVid-Bench,一个大规模以交互为中心的视频数据集,带有结构化关系标注,用于训练交互感知的视频生成模型。 尽管使用的训练数据和可训练参数远少于先前的运动控制方法,GraphVid 实现了强大的可控性和视频质量。与 Motion-I2V 相比,GraphVid 将 FID 降低了 39.9%,FVD 降低了 37.6%,同时 PSNR 从 9.87 提高到 15.98,SSIM 从 0.38 提高到 0.61。这些结果凸显了结构化语义接口作为可控视频生成范式的潜力。

论文精读

TL;DR GraphVid 将多对象交互建模为结构化图,让用户通过语义图直观操控视频生成,在数据与参数更少的情况下,质量与可控性显著超越基于轨迹的方法。

问题

可控视频生成领域正从单一运动迁移转向对多对象复杂交互的精确控制。现有方法主要依赖文本提示轨迹控制:文本虽灵活但难以约束精确的空间布局与时序交互;轨迹方法(如 Motion-I2V、DragVideo)则需要用户为每个实体绘制像素级运动路径,不仅操作繁琐,且在遮挡、重叠场景下轨迹定义变得歧义且极难维护。更关键的是,这类方法本质上仅约束像素位移或光流,缺乏对高层语义交互(如“A 推动 B”“C 躲避 D”)的结构化表达,导致生成结果常出现物理不合理或交互失真。

此问题的核心挑战在于:多对象交互的真实建模需要同时捕获空间关系图(相对位置、遮挡)与时序因果链(动作先后与响应),而当前条件信号(文本或运动场)均不具备对这种结构化关系的表示能力。同时,大规模视频数据普遍缺少交互关系标注,使得模型难以从数据中自发学会语义约束。在影视预演、虚拟环境构建、机器人仿真等应用中,工程界亟需一种既能灵活编辑、又能保证交互合理性的生成范式,这推动了对 结构化语义接口 的探索。

类似挑战在自动驾驶仿真中已显现:场景图定义了实体间的功能关系而非仅坐标轨迹,生成模型若能将此类抽象关系作为控制信号,便可大幅降低编排复杂行为的门槛。

核心洞察

  • **图结构控制是一种比密集轨迹更可扩展的多对象交互指定方式。** 现有方法如 Motion-I2V 需要用户为每个对象绘制精确的运动轨迹,随着对象数量增加和遮挡场景的出现,轨迹输入变得复杂且歧义。GraphVid 用结构化交互图(节点代表对象,边代表关系)替代逐点轨迹,用户只需指定对象之间的高阶语义关系(如“A 在 B 左边”“C 跟随 D”),模型自行推断合理的运动。这种抽象让控制输入与像素级运动解耦,显著降低了用户负担,同时提升了处理遮挡和重叠的鲁棒性,为复杂场景下的可控生成提供了更符合人类直觉的接口。
  • **结构化语义先验让视频生成模型在极低数据量下实现强可控性。** GraphVid 仅使用远小于 Motion-I2V 的训练数据和参数量,却在 FID、FVD 上取得大幅提升,PSNR 和 SSIM 也翻倍增长,这表明图条件注入的归纳偏置有效弥补了数据规模的不足。与依赖海量无标签视频学习运动模式的范式不同,GraphVid-Bench 数据集提供了显式的交互关系标注,模型得以直接学习“关系→运动”的映射,从而在样本效率上远优于纯轨迹监督方法。这对于资源受限或需快速适配新交互模式的应用场景具有重要工程启示:通过设计紧凑的结构化条件空间,可以大幅降低高质量视频生成的数据门槛。

方法

核心思路

GraphVid 采用图条件图像到视频生成范式,将多对象交互控制抽象为结构化关系图,替代传统轨迹或文本描述,实现灵活且精确的可控视频合成。

输入与表示

  • 起始帧:一张静态图像,作为视频生成的视觉锚点。
  • 交互图 (G = (V, E)):节点 (V) 表示目标对象(含类别、初始边界框等属性),边 (E) 编码对象间的交互类型与空间关系(如"追逐"、"抓取"、"遮挡"),可附带时序约束。

模型架构

基于预训练视频扩散模型(如 AnimateDiff 架构),插入图条件注入模块

  1. 图编码器:使用图神经网络(如 GAT 或 Transformer)将图结构映射为一组对象感知的嵌入向量,捕获交互语义。
  2. 条件融合:将图嵌入通过交叉注意力层注入扩散模型的 UNet 时空块,引导去噪过程同时关注对象关系与帧间运动。类似 ControlNet 的零卷积思想,但条件来自图而非控制信号。
  3. 训练策略:在 GraphVid-Bench(大规模带关系标注的视频数据集)上微调,只更新新增的图条件模块,冻结原扩散模型权重,大幅降低可训参数(比 Motion-I2V 更少)。

输出

基于起始帧和交互图生成一段视频,其中对象按图定义的交互关系自然运动,支持遮挡、重叠等复杂情形。

与同类方法的差异

GraphVid 将控制粒度从像素级运动曲线提升为语义级交互图,免去用户手动绘制精确轨迹的负担,在高对象密集和遮挡场景下保持控制鲁棒性,实现了控制灵活性与生成质量的平衡。

实验

实验设置

实验基于 GraphVid-Bench 数据集,该数据集包含大规模交互为中心的视频及结构化关系标注。模型以单张图像为输入,结合交互图条件生成视频。评估指标采用 FID、FVD 衡量生成质量与时间一致性,PSNR、SSIM 衡量与真实视频的像素级相似度。基线方法选择基于轨迹控制的 Motion-I2V

关键发现

尽管 GraphVid 使用的训练数据量和参数量均显著少于先前运动控制方法,其在所有指标上均取得显著提升:FID 相对降低 39.9%, FVD 降低 37.6%; PSNR 从 9.87 提升至 15.98 (+6.11), SSIM 从 0.38 提升至 0.61 (+0.23)。这表明结构化语义图条件能够更有效地引导视频生成,不仅在视觉质量上更优,而且时间一致性更强。

基线对比

Motion-I2V 等轨迹控制方法相比,GraphVid 通过交互图提供高层语义约束,用户无需为每个对象精确绘制运动轨迹,交互图的表达能力在遮挡、重叠等复杂场景下更具优势,避免了轨迹歧义。实验数据大幅领先,证明了图条件在可控视频生成中的潜力,也启示实际应用中结构化的用户接口可以同时提升控制精度和系统易用性。

行业影响

落地场景

GraphVid交互图为控制信号,天然适合需要精确多对象关系描述的视频生成任务。

  • 影视与广告预览:导演用节点-边定义角色、道具的时空关系,快速生成分镜视频,替代部分预演工作。
  • 电商与产品展示:输入商品图及关系(如“摆放在一起”“手持展示”),生成多产品互动演示,提升营销内容产出效率。
  • 教育与培训:以图描述实验器材、操作步骤的因果/空间关系,自动生成教学动画。
  • 游戏与虚拟世界:为 NPC 或物品设定互动规则,生成过场动画或用户定制内容,降低手动关键帧成本。

商业价值

  • 降本:相比传统逐帧动画或轨迹驱动方法,GraphVid 将控制输入从逐物体轨迹绘制简化为语义图编辑,大幅减少人工时间;实验显示其训练数据与参数量需求更低,推理门槛友好。
  • 体验提升:直接操纵语义关系而非像素运动,使复杂交互(如遮挡、传递)的生成更合理,减少后期修正。
  • 规模化:图结构易于批量生成与修改,适合内容平台自动化生产海量风格统一、节奏可控的短视频。

与现有产品/工作流的接口

  • 上游:接受图像或草图作为初始帧,图结构可通过可视化编辑器或自然语言→图转换模型生成,无缝衔接现有设计工具。
  • 下游:生成视频可直连剪辑软件、在线视频平台,或作为 3D 渲染前的 layout 预览。
  • 模型集成:作为“语义控制层”嵌入现有视频扩散模型流水线,例如与 Stable Video Diffusion 等组合,提供高层操控而不干扰底层纹理/风格生成。

具体落地用例

  1. 电商多商品讲解视频:商家上传三件商品图,用图定义“A 放在 B 旁边,C 被手拿起”,模型自动生成 5 秒动态展示,用于商品详情页或广告投放。相比手动编排,效率提升 10 倍且保障交互逻辑。
  2. 中学物理实验动画:教师用节点表示烧杯、磁铁等,边表示“靠近”“插入”,一键生成实验现象视频,替代耗时的手绘或实拍,尤其适合在线教育平台的内容批量制作。

局限

  • **图结构的预设依赖**降低了系统的即时交互性。用户需提前定义对象间的关系与属性图,对于动态变化场景或需要快速探索性生成的用户,手工构造图会增加额外负担。当视频中涉及临时出现、消失或关系突变的物体时,图需重新指定,而该过程目前缺乏自动化支持。这限制了**GraphVid** 在实时内容创作或需要快速迭代原型设计的场景中应用。图表达本身也可能存在歧义,如对象重叠时的空间关系难以用节点与边精确描述,导致生成结果对图微小扰动敏感。
  • **数据集覆盖面与泛化能力**尚未在极限开放条件下验证。**GraphVid-Bench** 虽提供结构化关系标注,但其物体类别、交互类型、背景复杂度均受限于收集过程。模型在其上训练的交互先验可能难以迁移到完全未见的对象组合或抽象关系(如情感性互动、物理不可达的状态转移)。当前评估依赖 **FVD**、**PSNR** 等指标,这些指标对语义错误的反馈较弱,可能掩盖模型在复杂交互中生成不合理运动或违反物理规律的情况。
  • **与强基线的对比不足**使方法的相对优势不够清晰。实验仅与 **Motion-I2V** 比较,但该基线代表的是轨迹控制的旧方法,未涉及基于关键点、骨骼或文本驱动的最新运动控制模型,也未与新兴的基于大型预训练模型的视频生成器(如扩散 Transformer 系列)对比。由于 **GraphVid** 使用更少参数和训练数据,其性能天花板可能受自身容量限制,在要求极端精细或长时序生成的场景下未必优于大参数量方案。
论文Vedant Shah2026-07-23原文

相关内容