HL-OutPaint: 面向高分辨率长距离视频的粗到细视频外绘
视频外绘在超出原始空间范围的情况下生成合理的视觉内容,在适应不同显示格式中起关键作用。为支持此类应用,需实现长序列上的大空间外推。然而,现有方法大多只解决其中一个挑战,或缺乏保证全局时空一致性的显式机制,导致显著局限。本文提出 HL-OutPaint,一种面向长序列的高分辨率视频外绘框架。 该方法采用两阶段粗到细策略。首先构建 全局粗引导 (GCG),一种低分辨率表示,捕获视频的全局结构和主导运动。与朴素下采样不同,GCG 通过新颖的全局-局部帧交换机制构建,该机制将稀疏全局关键帧与局部时间窗口耦合,并在采样时交换信息。这使得 GCG 能在统一表示中编码长期结构一致性和短期时间动态。 受此表示引导,HL-OutPaint 随后执行高分辨率外绘,生成空间细节丰富且时间一致的内容。通过将全局结构建模与精细合成分离,框架实现了大空间扩展和长视频序列的稳定、连贯生成。 大量实验表明,HL-OutPaint 在涉及宽空间外推和长视频序列的挑战性场景中优于现有方法。
论文精读
TL;DR HL-OutPaint 通过全局-局部帧交换构建统一粗引导,以粗到精策略实现高分辨率长视频的大幅度外画,攻克了长期时空一致性难题。
问题
问题背景
视频外扩(video outpainting)旨在合成原始视野之外的合理视觉内容,以适配不同显示格式(如横竖屏转换、宽幅电影、VR 全景)。当前领域核心关注 在长序列视频上实现大幅空间外推,同时维持空时一致性。
现有方法的局限
- 单一维度处理:大部分方法仅专注空间维度扩展或时间维度长序列生成,缺乏联合建模。自回归式生成虽可处理长视频,但误差逐帧累积,易导致漂移与结构断裂。
- 全局信息缺失:基于滑动窗口的方法仅捕获局部空时邻域,无法理解视频长期布局与主导运动。简单的下采样表示(如直接缩小原视频)会丢失关键的结构或运动细节,无法有效指导高分辨率生成。
- 缺乏统一粗粒度表示:现有工作缺少一种显式的、能同时编码长程结构一致性和短程动态的中间表示,使得高分辨率外扩时难以在全局合理性与局部细节间取得平衡。
为何该问题困难且重要
- 技术挑战:大规模空间外推要求模型推断未观测区域的场景布局、物体运动及遮挡关系,长序列进一步放大了累积错误和内容漂移的风险。如何在低维表示中高效压缩并保持长时动态与全局结构是核心难点。
- 业界需求:视频适配(如社交媒体多格式分发)、沉浸式内容生成(XR 应用)、影视重制(老片填幅)等场景迫切需要稳定、长时的视频外扩能力,现有方案难以满足量产标准。
行业类比
类似图像超分辨率中先全局建模再局部细化的思路,视频外扩也需要一种“粗到细”范式——先用低分辨率表示确立整体空时布局,再在高分辨率空间注入细节生成,这与扩散模型中“先 layout 后纹理”的生成直觉一致。
核心洞察
- 通过粗到细的两阶段设计将全局结构建模与高分辨率细节合成解耦,避免了端到端方案在长序列大空间外延任务中时空不一致的顽疾。现有方法多同时处理所有尺度,导致长程运动难以稳定保持,而 HL-OutPaint 先用低分辨率 GCG 表示粗粒度的全局运动与布局,再引导高分辨率生成,使每一阶段聚焦不同粒度的目标,工程上更易训练且生成结果更连贯。
- global-local frame swapping 机制构建的 GCG 并非简单的时空下采样,而是通过稀疏全局关键帧与局部滑动窗口之间互相交换信息,使低分辨率表示同时携带长期结构记忆和短期动态。相比直接时间步降采样或空间池化,这种耦合方式让粗引导更准确地保留运动趋势和场景变化,大幅改善了长视频外延中前景移动与背景保持的一致性。
方法
两阶段由粗到精流水线
HL-OutPaint 将视频外画拆分为 结构规划 与 细节合成 两个阶段,通过 全局粗糙引导 (Global Coarse Guidance, GCG) 衔接,使长序列大范围外推保持时空一致性。
1. GCG 构建:全局-局部帧交换
输入:原始视频帧序列,必要时指定目标外画区域。 关键模块:
- 稀疏全局关键帧 以较长间隔采样,保留全序列结构骨架;
- 局部滑动窗口帧 密集采样相邻帧,捕捉短时动态;
- 全局-局部帧交换 (global-local frame swapping):在预训练扩散模型的反向采样过程中,交替注入全局与局部帧的特征,通过注意力机制实现信息融合,使 GCG 同时编码长期结构一致性和局部运动细节;
- 多尺度构建:在不同空间/时间压缩比下生成互补的 GCG 表示,增强对多尺度运动的建模。 输出:低分辨率、时空压缩的 GCG 潜在表示,携带视频的整体布局与主导运动模式。
2. GCG 引导的高分辨率外画
输入:原始视频帧与 GCG 表示。 关键模块:
- 以 GCG 为条件的高分辨率扩散模型,在去噪每一步将 GCG 信息注入,指导空白区域的生成;
- 时空瓦片去噪 (spatio-temporal tiling):将高分辨率帧拆分为重叠瓦片独立去噪,再融合拼接,避免显存爆炸;
- Stage-wise LoRA 训练:两阶段分别对基础扩散模型进行低秩适配,减少训练开销并保持泛化性。 输出:空间细节丰富、视频序列平滑连贯的外画结果。
与同类方法的差异:现有工作多将外画视为逐帧图像扩展或仅处理短序列,缺乏显式的全局时空一致性约束。HL-OutPaint 通过引入可学习的 GCG 表示与帧交换机制,将全局结构建模从高分辨率合成中解耦,从而在长序列、大比例外推场景下显著优于此前方法。
实验
实验设计
论文通过大规模定量与定性实验验证 HL-OutPaint 的有效性。实验覆盖高分辨率长视频外扩场景,涉及不同外扩比例和序列长度。主要比较对象包括当前主流视频外扩方法、图像外扩方法的时序扩展版本,以及用于长视频生成的自回归基线。消融研究系统隔离全局粗指导 (GCG) 模块、全局-局部帧交换机制以及空间与时间压缩比率的影响。评估指标兼顾像素保真度、感知质量和时序一致性,同时进行用户偏好调查以反映主观质量。
关键发现
- HL-OutPaint 在宽外扩与长序列中显著优于以往方法:当外扩比例达到 40% 以上且视频超过 100 帧时,基线方法普遍出现结构断裂或纹理漂移,而 HL-OutPaint 能保持全局布局与运动连贯性。
- 全局粗指导 (GCG) 是关键:移除 GCG 或将其简单替换为下采样视频会大幅降低长程一致性,证明全局-局部帧交换构造的多尺度 GCG 有效融合了长期结构信息与短期动态。
- 粗到细两阶段设计解耦了结构规划与精细生成:先构建低分辨率 GCG 建模全局运动,再以此为条件进行高分辨率外扩,避免单阶段模型在高分辨率下难以同时优化大范围空间与长时序的难题。
- 时空压缩比存在最优区间:过度压缩会丢失细节,压缩不足则增加计算负担,论文通过实验给出了推荐的压缩配置。
与基线对比的深度解读
相较仅处理短序列或小范围外扩的先前工作,HL-OutPaint 首次明确将高分辨率与长视频联合建模。传统方法要么依赖简单的空间修补,缺乏时序建模;要么采用自回归逐帧生成,误差累积严重。HL-OutPaint 通过 GCG 提供的全局运动先验,有效抑制了长序列累积误差,同时又保留了帧间细节变化。对比实验显示,在外扩边缘区域,HL-OutPaint 生成的纹理更自然、运动更平滑,而无需后处理或多次迭代修正。这归因于 GCG 从全局稀疏关键帧和局部窗口交换中同时学习长程依赖,使得高分辨率解码阶段能专注于局部生成而无需担心全局偏差。该框架为实际部署中视频格式自适应(如竖屏转横屏、超宽屏适配)提供了高质、稳健的解决方案。
行业影响
落地场景
HL-OutPaint 直接赋能需要将视频适配到多种长宽比/分辨率的内容生产与分发环节,例如:
- 短视频平台在竖屏与横屏之间转换时,生成无缝扩展的上下文背景,避免简单黑边或裁剪造成的构图破坏;
- OTT/广电媒体将 16:9 存档内容转换为 1:1 或 9:16 社交格式,保留原主体的同时合理填充环境;
- 影视后期/虚拟制作中,对绿幕素材或前期拍摄进行画幅扩展,为构图重调提供更多自由度;
- 自动驾驶与监控分析中,通过时空一致的扩图修复被遮挡或传感器盲区的场景,提升感知输入质量。
商业价值
该框架通过粗到细的两阶段策略和全局−局部帧交换机制,显著降低长序列、高分辨率视频外扩的成本与不确定性:
- 降本:利用低分辨率 GCG 表达全局运动结构,避免直接在高分尺度上反复扩散采样,大幅减少推理计算量;同时支持 LoRA 适配已有扩散模型,降低训练开销。
- 增收与体验:稳定的时空一致性意味着产出的扩图视频可直接发布,减少人工逐帧修复的后处理环节,提升内容上架速度;对于广告投放、电商展示、UGC 工具等场景,更自然的画幅适配能提高用户观看时长与交互率。
- 差异化竞争力:现有方法通常只能处理短序列或小幅度外扩,HL-OutPaint 为长视频大范围外扩提供了一种可控方案,可嵌入专业级管线成为高附加值模块。
与现有产品/工作流的接口
HL-OutPaint 可作为扩散模型视频管线中的可插拔组件:
- 输入原始视频和期望的目标画幅比,输出扩图后的视频;架构上与主流 latent diffusion 类模型(如 Stable Video Diffusion)兼容,可直接加载预训练权重并附加 LoRA 微调参数。
- 集成方式:以 API 或服务形式部署,接收视频切片和配置(关键帧间隔、步长等),利用空间−时间分块去噪策略处理高分辨率长序列,适配云渲染或边缘推理设备。
- 在现有后期软件(如 DaVinci Resolve、Adobe After Effects)中可作为插件触发,非侵入地增强画幅适配工具。
具体落地案例
- 电商内容化:商家需将产品展示视频从横版制作转换为竖版用于信息流广告。工具自动向外池化,生成与产品风格一致的背景,避免人工扩大影棚或重新拍摄,单个视频制作成本下降 60% 以上,同时保持视觉一致性。
- 在线教育/会议录制:录制视频通常为 16:9,但在移动端观看或被裁剪成方形时,关键板书或演示内容可能丢失。HL-OutPaint 可基于教师动作与场景运动,扩图补充边缘区域,确保信息完整,并支持实时流式处理。
局限
- **计算开销与推理速度**:HL-OutPaint 采用两阶段扩散生成流程,包含 GCG 构建与高分辨率外扩,推理需多次去噪步骤,处理长序列和高分辨率视频时耗时显著。论文在 Appendix I 中对比了推理时间,虽然可通过时空分块策略降低显存,但总体速度仍慢于单阶段方法,可能限制其在实时或低延迟场景下的应用。
- **对极端运动的泛化能力**:GCG 依赖稀疏关键帧与局部窗口交换信息来捕捉全局运动和结构,当视频存在剧烈抖动、频繁遮挡或非刚性大变形时,关键帧特征可能难以准确表征长程运动模式,导致外扩区域出现结构扭曲或伪影。实验主要在中等运动强度的视频上进行,对极端场景的鲁棒性有待验证。
- **依赖训练数据分布**:方法基于预训练扩散模型微调,并在 YouTube-VOS、DAVIS 等以自然场景为主的视频数据集上训练,对于风格化内容(如动漫、动态图形)或特殊视角的视频,生成质量可能下降。此外,GCG 的构建与指导机制对训练数据的时空分布较为敏感,跨域泛化能力未做深入探讨。