论文

EffectLearner: 面向真实世界视频物体移除的世界感知物体-效应推理

EffectLearner: 面向真实世界视频物体移除的世界感知物体-效应推理

视频物体移除不仅要消除目标物体,还要消除其引发的效应,同时保持高保真度和时空连贯性。现有方法主要从预定义的效应类别和固定数据分布中隐式学习物体-效应对应关系,限制了其对复杂真实世界场景的泛化能力,这些场景涉及组合效应、空间分离或弱相关效应、长尾物理现象以及动态演化的交互。 为此,我们提出 EffectLearner,一种语义推理增强框架,结合了基于 VLM 的 Object-Effect Reasoner 与基于 DiT 的 Video Eraser。在结构化效应分析提示的引导下,Reasoner 对目标高亮视频进行跨模态推理,提取紧凑的效应感知上下文,引导 Video Eraser 实现全面的物体-效应移除。运动感知掩码引导和运动一致性监督进一步提高了物体运动和场景动态演化下的移除覆盖率和时空稳定性。 为了在挑战性真实场景中充分利用该框架,我们构建了 EffectWorld,一个专门针对复杂物体诱导效应的成对视频数据集,并引入渐进式训练课程,将通用监督与复杂效应数据相结合。 在标准 ROSE-Bench 上,EffectLearner 在大多数指标上优于现有基线,并在 EffectWorld-Eval 和更具挑战性的 EffectWorld-Wild 上表现出明显优势,证明了其在复杂真实场景中实现高质量视频物体移除的能力。

论文精读

TL;DR EffectLearner 利用 VLM 显式推理目标对象引发的复杂效果,引导 DiT 视频擦除器实现全面且时空一致的去除,并通过 EffectWorld 数据集解决真实场景泛化难题,性能超越现有方法。

问题

问题背景

视频对象移除(Video Object Removal)旨在从视频中擦除目标物体及其所有可见痕迹,并保持时空连贯的高质量背景修复,是视频编辑与内容生成领域的前沿课题。

现有方法局限

当前主流方法往往通过隐式学习建立物体与其效应的对应关系,且依赖预定义的效应类别和固定的数据分布。这类方案存在四个核心局限:

  1. 组合效应处理能力弱——真实场景中单一物体会同时产生阴影、反射、遮挡等多种效应,现有模型难以联合推理;
  2. 空间分离或弱相关效应难捕捉——例如物体已移出画面但远处仍留有倒影或光照变化,模型因缺乏全局关联而遗漏;
  3. 长尾物理现象(如动态模糊、运动拖影)在训练集占比低,推理时易出现伪影;
  4. 动态演化交互——物体运动过程中效应随帧连续变化,现有方法常出现时空不一致的闪烁或残留。

为什么这个问题难且重要

技术挑战在于:物体与其效应之间并非简单的一对一模板匹配,而是需要理解物理规律、场景语义和时序演化的跨模态推理。同时,擦除过程必须保证背景填充的真实感和运动连续性,这对生成模型的时空一致性提出极高要求。业界关注度持续上升,因为视频编辑、AR/VR、影视后期等领域对自动化对象移除的需求非常强烈,而现有工具在复杂真实场景下仍依赖大量人工修正。

行业类比

类似自动驾驶中的长尾场景感知:常见情况处理得很好,但真正决定系统可靠性的,是那些低频但组合复杂的边缘案例——视频物体移除也需从“类别驱动”走向“世界知识驱动”的推理范式。

核心洞察

  • 该工作首次将 VLM 的跨模态推理能力引入视频对象移除,使模型不再依赖预定义的效果类别和固定数据分布。通过结构化效果分析提示,VLM 显式解析目标对象引发的复合效果、空间分离的弱关联效应以及长尾物理现象,生成紧凑的效果感知上下文,直接指导后续的 DiT 擦除器。这与现有方法仅从数据中隐式学习对象-效果对应关系形成根本差异,从而显著提升了对复杂真实场景的泛化能力。
  • 论文构建了包含多样化复杂对象诱发效果的 EffectWorld 数据集,并配套渐进式训练课程:先以通用数据预训练基础视频修复能力,再使用复杂效果数据微调。这种针对效果推理的训练策略让模型系统性地接触了现实世界中难以预见的对象移除场景,解决了标准基准(如 ROSE-Bench)上表现良好但实际泛化不足的问题,为视频编辑模型的实用性评估提供了新的范式。
  • 运动感知的时空稳定性设计是提升视频移除覆盖率和一致性的关键工程优化。通过运动感知掩码引导,擦除器能动态跟踪对象及效果的运动轨迹,避免移除残余;运动一致性监督则显式约束前后帧的修复结果,抑制闪烁和伪影。这一简单但有效的机制在对象运动与场景动态演变下仍能保持高质量输出,弥补了现有视频移除方法在处理动态长序列时的时空不稳定性缺陷。

方法

输入:目标高亮视频

输入为短时序视频,用户通过目标掩码 标注待移除对象。掩码被渲染为半透明覆盖层,生成目标高亮视频(target-highlighted video),在保留背景外观的同时突出对象区域,便于后续VLM跨模态推理。

关键模块与处理流程

1. VLM 驱动的对象-效果推理器(Object-Effect Reasoner)
  • 以现成视觉语言模型(VLM)为核心,接收目标高亮视频和结构化提示词(structured effect-analysis prompt),提示词引导模型分步分析:对象属性、空间邻接区域、时序动态。
  • 推理器识别所有对象诱发效果(如阴影、反射、烟雾、飞溅、拖影、扬尘等),并生成紧凑的效果感知上下文(effect-aware context)——一组文本嵌入,编码效果类别、空间范围与时间模式。
2. 语义引导的 DiT 视频擦除器(Video Eraser)
  • 基于 Diffusion Transformer(DiT)的视频生成架构,以原始帧、目标掩码和效果感知上下文为条件。效果上下文通过交叉注意力 注入去噪过程,指导网络同时擦除对象及其效果。
  • 为增强运动场景稳定性,引入两项机制:
    • 运动感知掩码引导:利用光流膨胀掩码,覆盖移动物体的瞬态效果区域。
    • 运动一致性监督:训练时约束相邻帧特征平滑,抑制修复区域闪烁与抖动。
3. 训练策略
  • 作者构建了专门数据集 EffectWorld,包含大量复杂效果的真实配对视频,涵盖组合效果、长尾物理现象和动态交互。
  • 采用渐进式课程:先在常规视频上预训练基础擦除能力,再用 EffectWorld 微调,逐步增强对复杂效果的推理与移除能力。

输出:高质量无对象及效果的高清视频

网络输出擦除后的视频序列,最终生成视觉效果流畅、时空一致的修复视频。

与同类方法的核心差异

以往方法从固定效果类别中隐式 学习对象-效果映射,泛化受限。EffectLearner 通过 VLM 显式推理 对象诱发效果,能以开放词汇理解任意效果现象,并借助运动感知模块保障动态场景稳定性,大幅提升真实世界复杂场景下的对象移除保真度与鲁棒性。

实验

实验设计

  • 评估基准:ROSE-Bench 标准测试集,以及自建的 EffectWorld 数据集(含 EffectWorld-Eval 和特具挑战的 EffectWorld-Wild)。
  • 训练策略:采用渐进式课程,先使用常规视频数据,再引入 EffectWorld 中的复杂效果样本,帮助模型逐步适应长尾、组合式效果。
  • 主要对比基线:已有视频物体移除方法(如未列名,泛指基于隐式学习的先前工作)。

关键发现

  • 在 ROSE-Bench 多数指标上取得最优,尤其在需要理解物体引发效果(如阴影、反射、运动模糊)的场景优势显著。
  • 在 EffectWorld-Eval 和 EffectWorld-Wild 上,EffectLearner 大幅超越基线,证明显式语义推理对处理空间分离、弱相关及动态演化效果的有效性。
  • 消融实验证实 VLM 推理模块、运动感知掩码引导 及 运动一致性监督 的各自贡献。

与基线的深度对比

  • 以往方法仅从预定义类别和固定分布中隐式学习对象-效果对应,难以应对组合效果或长尾现象;本文框架通过 结构化效果分析提示 引导视觉语言模型显式推理效果上下文,实现从数据拟合到语义理解的转变。
  • 引入的运动感知机制改进了掩码对运动对象的覆盖,结合时序一致性损失,有效缓解了基线在动态场景下的闪烁与残留。

行业影响

落地场景

EffectLearner 的核心能力是“世界感知的对象-效应推理”,能够移除视频中的目标物体及其引发的物理效应(如阴影、反射、烟雾、动态交互痕迹),并保持时空连贯的高保真恢复。这一能力可直接应用于:

  • 视频内容生产与后期:广告、影视、短视频创作中,需要快速擦除不需要的物体(如入镜路人、品牌 Logo、穿帮道具),同时自动清除其连带的环境效应,大幅减少逐帧修补的手工量。
  • 电商与商品展示:在商品视频中移除支架、反光板、无关装饰物,并自然恢复被遮挡的背景,提升视觉专业度。
  • 自动驾驶与机器人数据增强:从真实路采视频中擦除特定车辆、行人,生成用于感知模型训练的干净背景片段,或构建 corner case 仿真数据。
  • 视频分析与隐私保护:在监控或 UGC 内容中自动移除敏感物体,且不留下痕迹,比传统模糊或贴图更自然。

商业价值

  • 降本:自动化视频擦除将原本需数小时/帧的资深合成师工作压缩至分钟级,降低人力成本。EffectWorld 数据集与渐进训练课程使其在复杂现实场景中仍保持强泛化,减少定制化调参投入。
  • 增收:对于内容平台,高质量视频擦除可作为会员增值功能(如“一键去水印/去路人”),拉动订阅转化;对于视频制作工具,可提供差异化高级编辑能力,提升产品单价。
  • 体验提升:端到端移除物体及其效应,避免了现有方法常常留下的“鬼影”或效应残留,提升最终画面可信度,改善用户满意度与内容传播效果。

与现有产品/工作流的接口

EffectLearner 采用 VLM + DiT 的双阶段架构,可松耦合集成:

  1. 输入接口:接受带目标掩码的视频帧序列,掩码可通过现有交互式分割工具(如 SAM 系列)自动生成,无需用户逐帧绘制。
  2. 推理管线:VLM 部分通过结构化 prompt 输出效应感知上下文,可部署在轻量 API 服务;DiT 视频擦除器可利用现有扩散模型加速框架(如 TensorRT、OneDiff)进行优化。
  3. 数据闭环:生产环境中产生的用户反馈数据可沉淀为类似 EffectWorld 的配对样本,持续微调模型,形成自适应改进飞轮。

具体落地场景举例

  • 场景一:电商直播视频自动美化:在直播带货回放中,主播讲解时画面常出现杂乱的样品台、反光板支架。使用 EffectLearner,运营人员只需在首帧标记待移除物体,系统即可自动擦除其本身及产生的阴影、遮挡反光,输出干净流畅的商品展示片段,用于切片分发。
  • 场景二:自动驾驶 Corner Case 生成:AIGC 驱动的仿真系统需要大量无目标对象的真实道路背景,以插入虚拟障碍物。EffectLearner 可从采集的路采视频中擦除移动车辆,并同时消除车灯反射、路面阴影等关联效应,生成几何与光照一致的背景序列,显著提升合成数据的真实感与模型训练效果。

局限

  • 对 VLM 推理质量的依赖:**EffectLearner** 的核心是 **VLM-based Object-Effect Reasoner**,其分析能力受限于 VLM 的预训练知识与跨模态对齐质量。面对长尾物理现象、罕见复合效果或视觉线索稀少的情形,VLM 可能输出模糊甚至幻觉式的效果描述,进而误导 **Video Eraser** 的修复过程,引入时空不一致的伪影。此外,VLM 的推理延迟与计算开销会显著拖慢端到端处理速度,论文未探讨轻量级 VLM 或推理缓存策略,这对实时交互或大规模视频处理场景构成工程瓶颈。
  • EffectWorld 数据集覆盖范围的局限:论文为复杂效果专门构建了 **EffectWorld** 数据集,但其构建过程依赖合成管线与特定模拟规则,不可避免地存在分布偏差。真实世界中动态光影交互、非朗伯表面反射、流体湍流等高维物理现象难以被穷举,模型在这些未充分建模的效果上可能出现遗漏或错误修复。尽管在 **EffectWorld-Wild** 上表现优异,该优势可能部分来自训练与测试分布的同源性,距离真正开放域、零样本的世界感知仍有一定差距。
  • 目标高亮输入的前置依赖:方法要求提供**目标高亮视频**作为输入,这需要预先获取精确的对象分割掩码,通常依赖额外模型或人工标注。当目标边界模糊、半透明或存在动态遮挡时,掩码质量下降会直接损害 Reasoner 的语义分析精度,进而影响擦除完整性。与一些能够从自然语言提示或用户笔划直接推断移除区域的端到端视频编辑方法相比,**EffectLearner** 的交互方式更繁琐,限制了其在无辅助标注的全自动内容生产管道中的适用性。
论文Feier Wu2026-08-06原文

相关内容