论文

FlowLong: 基于流形约束 Tweedie Matching 的推理时生成长视频

FlowLong: 基于流形约束 Tweedie Matching 的推理时生成长视频

将视频扩散模型的生成范围扩展到长序列仍然是一个长期且重要的挑战。现有的免训练方法分为两类:双向模型的扩展,与特定架构紧密耦合且在长序列中质量下降;以及自回归模型,由于曝光偏差累积漂移误差,容易产生重复运动模式。 为解决这些问题,我们提出了一种新颖且简单的推理时长视频生成方法,该方法与架构无关,无需额外训练。我们的方法通过重叠滑动窗口生成长视频,相邻窗口的预测干净样本通过 Tweedie Matching 进行融合,以在重叠区域强制施加 流形约束 和时间一致性。然后,随机早期采样 在每个 Tweedie Matching 校正后的高噪声阶段注入新鲜噪声,以同步各窗口轨迹,之后过渡到确定性 ODE 采样以保留精细的视觉保真度。 在多种视频生成模型上,我们的方法生成了比原生窗口长度长数倍的视频,在时间一致性和视觉质量上优于免训练和自回归基线,并进一步扩展到了音频-视频联合生成和 text-to-3DGS,无需任何微调。

论文精读

TL;DR FlowLong 通过滑动窗口重叠区的 Tweedie 匹配与随机早期采样,推理时无训练即可生成高质量长视频,解决自回归漂移和双向退化问题。

问题

长视频生成是视频扩散模型领域的核心挑战之一。现有模型受限于训练窗口长度,直接生成超过原生时长的视频常出现质量下降和运动不一致问题。

现有方法局限:目前训练无关的长视频生成方案主要分为两类:

  • 双向模型扩展:这类方法依赖特定的模型架构(如帧插值网络),与骨干模型紧耦合,泛化性差。在生成长视频时,随着生成帧数增加,画面质量逐渐恶化,时序抖动明显。
  • 自回归生成:通过逐帧预测的方式扩展长度,但存在 曝光偏差(exposure bias),即训练与推理时的条件分布不匹配,导致漂移误差累积,往往产生重复、僵硬的运动模式。

技术难点:长视频生成需要在长时间轴上维持帧间一致性、保持视觉保真度,同时还要控制误差传播。这涉及到多个滑动窗口的采样轨迹对齐,以及在高噪声阶段协调随机性,对推断机制的设计提出了极高要求。随着 Video DiTs 在影视创作、虚拟现实和游戏等行业的广泛应用,长视频生成能力的突破直接影响 AI 内容生成的实用性。

一个直观的类比是:就像让语言模型撰写一部长篇小说,不仅要保证单段文字的质量,还要维持跨章节的连贯性与风格统一,长视频生成同样面临 长程记忆误差积累 的双重困境。

核心洞察

  • **流形约束的 Tweedie 匹配在重叠窗口间混合预测干净样本**,从根本上缓解自回归生成长视频的漂移积累与重复动作。现有训练免方法要么强绑定特定双向架构且质量随长度衰减,要么因自回归暴露偏差产生运动模式重复;该方法利用 Tweedie 公式将重叠区域视为多窗口观测,通过加权聚合强制生成样本落在数据流形上,实现结构无关的时序一致长视频生成,且无需额外训练或微调。
  • **随机早期阶段采样在扩散轨迹的高噪声阶段注入噪声**,同步不同滑动窗口的去噪路径,再切换确定性 ODE 保持细节。这与以往在整个过程均匀采样的策略不同,仅在流形约束校正后于早期注入少量噪声,既避免自回归场景下确定性采样带来的僵硬运动,又防止后期随机采样破坏视觉精细度,在时间连贯与画质之间取得更优平衡。

方法

FlowLong 是一种推理时的长视频生成方法,无需额外训练,与架构无关,适用于各种视频扩散模型(如 Video DiT)。其核心思路是利用重叠滑动窗口将长视频分割为连续片段,通过窗口间的信息共享来维持时间一致性。

输入与预处理

给定一个预训练的视频扩散模型,输入包括文本提示和初始噪声,推理过程从高噪声阶段逐步去噪。滑动窗口在潜在空间中定义,相邻窗口共享一段重叠区域(如 50% 重叠),每个窗口独立执行去噪采样。

关键模块

  1. Tweedie 匹配(Tweedie Matching)
    在相邻窗口的重叠帧上,利用 Tweedie 公式 从当前噪声估计中预测干净样本(clean sample),并将两个窗口的预测结果进行加权混合。这相当于在重叠部分施加了流形约束,使得两个窗口的去噪轨迹对齐到数据流形上的一致解,从而避免边界不连续和运动断层。混合权重沿时间帧平滑变化(如余弦调度),确保平滑过渡。

  2. 随机早期阶段采样(Stochastic Early-Phase Sampling)
    在高噪声的早期去噪步骤(例如前 50% 步)中,每次执行 Tweedie 匹配校正后,重新注入独立噪声,使各窗口的随机轨迹再次发散。这迫使每个窗口在后期去噪中重新探索更协调的全局时序结构,有效抑制了自回归方法常见的曝光偏差和重复运动模式。

  3. 确定性 ODE 采样切换
    进入低噪声后期阶段后,算法切换到确定性 ODE 采样(如 DDIM 反转),不再注入噪声,仅依靠 Tweedie 匹配维持重叠区一致性,从而保留精细的视觉细节和运动高频信息。

输出

最终将各窗口去噪后的潜在表示在重叠区域按帧聚合,形成连贯的长视频潜在序列,再解码为像素视频。生成的视频长度可达到原生窗口的数倍,且时序平滑、画质无明显退化。

工程扩展

该方法同样适用于音频-视频联合生成(重叠区域同时对齐音画)和文本到 3DGS 生成,只需将窗口定义在时空或视点维度即可,显示了良好的泛化性。

与两类主流训练无关方案的差异:

  • 双向模型扩展需侵入式修改架构,长序列下质量易退化;
  • 自回归模型因曝光偏差积累漂移误差,易产生重复运动; FlowLong 通过 Tweedie 匹配 + 随机噪声同步 在推理时动态校正窗口间轨迹,兼具架构无关性和高时序一致性,无需任何微调。

实验

实验设计

论文在多个主流视频扩散模型(如 VideoCrafter、OpenSora)上验证 FlowLong 的长视频生成能力。核心流程:

  • 使用重叠滑动窗口逐段生成视频,相邻窗口的重叠区域通过 Tweedie matching 混合预测的干净样本,施加流形约束并保持时间一致性。
  • 在高噪声早期阶段引入随机早期采样:每次 Tweedie matching 校正后重新注入噪声,同步各段扩散轨迹;在后期切换至确定性 ODE 采样,保护细节保真度。
  • 生成视频长度为原生窗口的数倍,评估指标聚焦时间一致性视觉质量
  • 进一步扩展到音频-视频联合生成text-to-3DGS,验证方法的即插即用能力,无需任何微调。

关键发现

  1. 架构无关与零训练:FlowLong 作为纯推理时方法,可直接应用于各类预训练视频扩散模型,无需修改架构或额外训练。
  2. 长程一致性的突破:通过流形约束的 Tweedie matching,避免了自回归方法的曝光偏差重复运动模式,也克服了双向模型在长序列上常见的质量退化。
  3. 轨迹同步机制:随机早期采样有效防止各窗口扩散轨迹的发散,保障长视频的连贯性,而后期确定性 ODE 保留高频纹理。
  4. 跨任务泛化:在音频-视频联合生成中实现声画同步,在 3D/4D 生成(text-to-3DGS)中验证了框架的通用性。

与基线对比解读

  • vs 自回归模型:传统逐段自回归方法因前一输出作为后一段条件,累积误差导致漂移和动作重复。FlowLong 通过重叠窗口双向约束,显式修正漂移,生成的长视频运动更多样自然。
  • vs 双向模型扩展:双向方法通常绑定特定架构(如 UNet 中的时空注意力),长距离信噪比下降,画面模糊。FlowLong 利用流形匹配在隐空间优化,无需改变模型结构,维持清晰度。
  • 融合机制的优势:Tweedie matching 比简单的隐变量线性混合更精准保留流形结构,随机早期采样则像一种“矫正性重启”,防止中间帧塌缩。整体方案在零额外训练的前提下,达到甚至超越需调参的基线水平。

行业影响

落地场景

FlowLong 为长视频生成提供了即插即用的推理时方案,可立刻应用于内容生产、广告创意、电商展示、社交媒体、影视后期及虚拟现实等场景。由于无需额外训练且架构无关,它能将现有短时视频扩散模型的能力直接扩展到生成数分钟的长序列。配合音视频联合生成能力,适用于短视频平台的自动配乐与音效合成;文本到 3DGS 的扩展则可服务于 3D 资产快速生产,如虚拟试衣、AR/VR 应用。

  • 电商行业:批量生成商品展示长视频,代替人工拍摄,大幅提升上架速度。
  • 教育/企业培训:从讲义文本生成连贯的讲解动画,降低制作成本。
  • 短视频创作:创作者输入脚本即可获得带背景音的长视频,直接用于发布。

商业价值

  • 降本:避免为长视频重新训练大模型,节省数十万 GPU 小时的计算开销;推理时方案无需维护额外模型版本,减少工程维护成本。
  • 增收:提高内容产出效率,电商平台可快速测试不同视频素材,提升点击转化率;内容平台可吸引更多创作者,增加用户活跃与广告库存。
  • 体验提升:长视频的时序一致性和视觉质量显著改善,减轻“漂移”和重复动作问题,使 AI 生成内容更接近专业拍摄效果,降低人工后处理需求。

与现有产品/工作流的接口

FlowLong 本身是一个推理时后处理模块,可作为 ComfyUI 自定义节点Diffusers pipeline 扩展 直接嵌入现有视频生成工作流。它接受已加载的预训练模型,在推理阶段通过滑动窗口 + Tweedie 匹配修正输出,不影响基础模型结构。

  • Stable Video DiffusionVideoCrafterOpen-Sora 等模型兼容,只需在生成循环中插入窗口融合与噪声重注入步骤。
  • 可封装为 API 服务,供视频编辑软件(如 After Effects 插件)或云端内容平台调用。
  • 音视频联合生成可接入 TTS 或音乐生成模型,形成端到端多模态内容生产管线。

具体落地 Use Case

  1. 电商视频自动生成平台:某电商平台使用商品图片和描述,通过文本到视频模型生成长达 60 秒的商品介绍视频,并自动添加背景音乐。FlowLong 保障了多镜头间的动作连贯与画面稳定,使视频可直接用于广告投放,无需人工剪辑,将单视频制作成本从数百美元降至几美分。
  2. 在线教育动画课程生产:教育科技公司利用 FlowLong 从教材文本生成连续的动画课程,每个知识点覆盖 3-5 分钟,画面风格统一、动作流畅,替代了传统逐帧制作流程,使课程上线周期从数周缩短至数小时。

局限

  • **对底层模型能力的依赖**:FlowLong 作为推理时方法,不修改预训练生成模型,因此长视频质量严重受限于基础模型的生成能力。若基础模型在短片段内已存在运动不连贯或伪影,通过窗口重叠和 Tweedie matching 可能无法彻底弥补,极端情况下反而会传播错误。
  • **推理算力开销较高**:滑动窗口重叠区域需要为每个窗口独立运行扩散采样,再额外执行 Tweedie matching 进行隐空间优化,这导致总前向步数随窗口数线性增长。虽然论文未详细报告延迟数据,但相比于直接生成全长的训练特化方法,推理成本明显更高,对实时或大规模应用不友好。
  • **极长序列下的稳定性未充分验证**:论文评估的长度最多为原始窗口的数倍(例如 5~10 倍),但未探讨在数十万帧或分钟级视频上结构化噪声注入策略是否仍然有效。当噪声调度或窗口重叠率设置不当时,随机早期采样可能引入不自然的运动突变,而这类超参数敏感性缺少系统性消融。
论文Jangho Park2026-05-20原文

相关内容