从合成到去除:基于物理的反射模拟与基于扩散的视频去反射
视频反射 会降低视觉质量并干扰下游任务。尽管单图去反射已有广泛研究,视频反射去除 仍因缺乏成对视频数据、时序一致模型和专用基准而鲜有探索。为此,我们提出一个 闭环框架,统一物理驱动的反射模拟、基于扩散的视频去反射和基准评测。 我们的 S2R-Synthesis 流程在结构空间进行物理增强,渲染逼真反射视频,建模玻璃引起的模糊、重影和反射率变化。基于合成数据,我们提出 S2R-Removal,首个基于扩散的视频去反射模型,通过反射感知潜在适配和一步像素-几何精炼恢复干净透射。我们进一步构建 S2R-Bench,首个视频去反射基准,支持全参考评测和真实人工感知评估。 实验表明,我们的方法在 S2R-Bench 和多个公开图像基准上达到 最先进性能,推理速度快于非扩散基线,并验证了 S2R-Synthesis 的有效性。
论文精读
TL;DR 该工作构建了从物理反射合成到扩散去反射的闭环:**S2R-Synthesis** 生成逼真成对视频,**S2R-Removal** 用扩散先验单步去除反射,速度与性能均达最先进水平,并推出首个视频去反射基准 **S2R-Bench**。
问题
问题背景
视频已成为主流信息载体,视觉分析、自动驾驶、视频会议等场景中,通过玻璃拍摄产生的反射严重退化画质,视频反射去除 (video reflection removal) 逐渐成为底层视觉的研究热点。
现有方法局限
当前视频去反射方法大多继承单图像思路,存在三个关键瓶颈:
- 配对数据稀缺:真实场景难以同时采集有/无反射的视频对,监督信号严重不足,现有合成数据与真实域存在显著差距。
- 时序一致性缺失:多数方法逐帧独立处理,忽视帧间光流与运动关联,输出视频易出现闪烁、鬼影漂移等伪影。
- 评估基准空白:缺少统一测试集和感知指标,方法间难以公平比较,阻碍了工程落地验证。
为什么这个问题难且重要
反射层与透射层在时空上高度耦合,分离属于病态逆问题;真实反射受玻璃粗糙度、厚度、折射率等物理属性影响,呈现模糊、鬼影、局部遮挡等复杂形态,难以用简单线性叠加建模。此外,视频输出要求严格的时间稳定性,不能有帧间亮度突变或纹理错位,这比单图去反射更困难。业界对视频质量要求持续提高,车窗反射干扰自动驾驶感知、玻璃白板反射影响会议记录、手机视频拍摄需要实时去除反射,需求明确且迫切。
行业类比
如同视频超分辨率从单帧走向多帧利用时序信息,视频去反射也必须从逐帧独立处理转向时空联合建模,才能在实际部署中满足稳定性和效率要求。
核心洞察
- 通过物理grounded结构空间增强与视频扩散渲染器生成配对反射视频,解决视频去反射任务数据匮乏的核心瓶颈。
- 与单图像去反射已有大量合成与真实配对数据不同,视频去反射长期受困于缺乏成对时序数据;S2R-Synthesis没有简单在像素域混合反射层,而是对玻璃粗糙度、厚度、反射率等物理效应在结构空间建模,再渲染为真实反射视频,确保反射形态随时间自然变化。这一思路将物理先验与扩散生成能力结合,为其他低资源视频恢复任务提供了可复用的数据合成范式。
方法
S2R-Synthesis:物理 grounded 配对视频生成
- 输入:真实无反射视频与物理参数(粗糙度、厚度、反射率、部分覆盖等)。
- 关键模块:在结构空间进行 physics-grounded augmentation,模拟玻璃粗糙度引起的模糊、厚度引起的鬼影、反射率变化;随后用训练好的 video diffusion renderer 渲染为逼真带反射视频,获得严格配对的 reflected / reflection-free 视频。
- 输出:大规模合成训练数据,并支撑 S2R-Bench(含全参考 S2R-Ref 与真实场景 S2R-Real 的人类感知评估)。
S2R-Removal:一步扩散视频去反射
- 输入:带反射视频帧序列。
- 关键模块:
- Reflection-Aware Latent Adaptation:以预训练 video diffusion prior 为基础,通过反射强度头和注意力调制,让潜空间表征适配反射退化并保留时序一致性。
- One-Step Pixel-Geometric Refinement:单步去噪后,用像素空间损失与反射感知深度一致性损失细化干净透射层,抑制伪影并恢复高频细节。
- 输出:单步去噪得到的无反射视频,推理速度快于多数非扩散基线。
与同类方法的差异点
这是首个 diffusion-based video dereflection 模型,利用物理合成数据与视频扩散先验,在单步去噪内完成时序一致反射去除,避免了成对视频数据稀缺与多步采样开销。
实验
实验设计
作者构建了 S2R-Bench,包含 S2R-Ref(全参考评估)和 S2R-Real(真实世界人类感知评估)。训练数据由 S2R-Synthesis 物理引导合成,在结构空间做增强后经视频扩散渲染器生成配对反射/无反射视频。
S2R-Removal 分两阶段:Stage I 反射感知潜在适应,Stage II 一步像素几何细化。模型在 S2R-Bench 及多个公共图像基准上评估,对比非扩散视频去反射方法、通用视频编辑模型等。
关键发现
- 在 S2R-Bench 和公共图像基准上达到 state-of-the-art 性能。
- 单步去噪推理速度快于非扩散基线,兼顾效率与质量。
- S2R-Synthesis 有效解决配对视频数据缺乏问题,物理增强(粗糙度模糊、厚度鬼影、反射率变化)提升真实感。
基线对比解读
相比先前视频去反射方法,本文首次引入视频扩散先验,通过潜在适应保留时序一致性,像素级细化恢复高频细节,避免传统方法的过平滑或鬼影残留。与通用视频编辑模型相比,物理模拟使反射去除更贴合物理成因,减少幻觉。单步推理使得扩散模型的应用从“昂贵”变为“实时可行”,在工程部署上具有吸引力。
行业影响
落地场景
- 视频会议与直播:摄像头隔着玻璃或屏幕拍摄时,反射会干扰人脸、白板内容;S2R-Removal 可作为实时预处理,提升远程协作与在线教育的画面可用性。
- 自动驾驶数据闭环:车载摄像头透过挡风玻璃采集,反光会污染车道线、交通标志等关键信息。将去反射模块前置到采集或标注流程,可提高感知模型训练数据的质量。
- 电商内容生产:商品展示视频常在玻璃柜、橱窗等反光环境中拍摄,批量去反射可减少重拍和人工修图成本。
商业价值
- 降本:避免因反光导致的废弃素材和后期人工修复,尤其对大规模 UGC 内容平台。
- 体验提升:视频通话、远程医疗等场景中减少反射干扰,降低用户流失;电商直播中商品细节更清晰,可减少退货率。
- 增收:作为差异化能力嵌入拍摄/会议硬件或 SaaS 工具,形成付费点。
与现有工作流集成
- 部署形态:单步扩散推理速度优于部分非扩散基线,可封装为轻量 GPU 服务或端侧模型(ONNX/TensorRT)。
- 接口方式:作为 ffmpeg filter、云函数或预处理 API 插入现有视频采集/存储/分析管道;也可与 VLM、OCR、检测模型串联,在输入前统一去反射。
- 数据增强:S2R-Synthesis 可生成成对反射/无反射视频,用于训练内部感知模型,提升对反光场景的鲁棒性。
具体 use case:
- 自动驾驶车队数据清洗:采集车辆在前挡风玻璃存在反光时,S2R-Removal 作为数据预处理步骤,清除反射后再送入标注与训练,降低感知模型在逆光/夜间场景的漏检。
- 电商直播实时增强:主播使用玻璃白板或展示柜时,对视频流做轻量去反射,使商品和文字内容清晰可见,减少观众因看不清而退出,间接提升转化率。
局限
- **合成数据域差距**:S2R-Synthesis 通过物理增强和视频扩散渲染器生成配对数据,但真实玻璃反射涉及复杂的光学交互,如多层玻璃、非均匀介质、偏振效应、污渍与划痕等,物理原语难以完全覆盖。训练分布与真实分布之间的偏差可能导致模型在未见场景中出现残留反射或过度平滑,尤其在强反射、低光照或高动态范围视频中泛化能力受限。
- **扩散先验依赖与单步去噪风险**:S2R-Removal 依赖预训练视频扩散先验,并通过 reflection-aware latent adaptation 和单步像素几何细化实现快速推理。然而,单步去噪对复杂反射的去除可能不充分,尤其在反射与透射层空间频率重叠严重时,先验可能偏向生成高频细节而引入伪纹理。此外,该方法对预训练模型的选择敏感,若基础视频扩散模型在某些运动或纹理上存在偏置,去除结果会受到影响。
- **基准与评估体系尚不完善**:S2R-Bench 作为首个视频反射去除基准,其规模、场景多样性和标注精细度仍需扩充。真实世界评估依赖人工感知,主观性较强,缺乏自动化的时空一致性指标;同时,未系统比较不同反射类型(如静态反射、动态反射、部分覆盖)的独立表现,也未与视频修复、去雾等相邻任务的统一协议对齐,限制了结论的普适性和可复现性。