InfinityEdit: 使用轻量级编辑点火适配器的无限视频编辑
现有视频编辑方法 依赖大模型,但大多基于原地编辑假设,对直播游戏或持续镜头等开放流不适用。本文将其定义为 无限视频编辑:给定前序片段和编辑指令,模型需生成应用了编辑的下一段视频,并随指令序列无限延续。挑战在于:编辑必须忠实延续而非逐帧改写,且随编辑累积生成质量保持稳定。 为此,作者设计了 数据收集流水线 用于训练。并提出 InfinityEdit —— 一个轻量编辑适配器,为流式视频生成器赋予无限编辑能力。适配器包含三个注意力模块:历史交叉注意力 利用输入帧引导去噪;时序因果自注意力 保证时序信息仅从早帧流向晚帧;编辑交叉注意力 注入编辑请求。推理时,适配器仅在编辑指令到达的 chunk 激活,后续 chunk 由原模型配合重置锚帧生成,兼顾编辑效果与原始无限生成能力。 实验表明,InfinityEdit 能在各类编辑下忠实延续流,并在无限编辑序列中保持稳定。
论文精读
TL;DR InfinityEdit 用轻量级编辑适配器(含历史交叉注意力、时序因果自注意力、编辑交叉注意力)实现无限流式视频编辑,在编辑指令不断到来时持续生成后续帧,同时保持长期稳定性。
问题
指令驱动的视频编辑(instruction-based video editing)已通过大模型取得显著进展,但主流范式假定编辑在固定长度、帧对齐的源视频上进行,适用于短片重风格化或局部修改。
现有方法普遍依赖 in-place editing assumption,即逐帧对齐源与目标剪辑的时间跨度,编辑过程是将给定 clip 重写为同长度新 clip。这带来两个具体技术限制:一是无法处理 开放流式视频 (如直播、实时游戏画面),因为新帧不断到达,要求模型对未见过的未来帧持续应用编辑;二是编辑操作本质上是回顾性重写而非 生成式延续,当编辑要求随时间累积或扩展时,模型难以在保留历史运动与内容的同时协调多次编辑,容易产生时间闪烁或内容漂移。
难点在于同时满足三重要求——忠实延续前序流、注入当前编辑意图、并保持无限生成的稳定性。流式生成要求严格的 时间因果性 (未来帧不能影响过去),而编辑通常需全局上下文,两者冲突。编辑累积还会带来误差放大:每一次错位或伪影都可能被后续生成作为条件放大,导致质量快速退化。这对应业界对实时视频处理、虚拟制作、远程协作等场景的底层需求,也是 流媒体与生成模型 结合的关键挑战。
类比生成式游戏引擎的实时渲染管道,需要在不打断玩家输入流的前提下,持续对画面应用风格或物理规则变更。
核心洞察
- - 将无限视频编辑从“帧级重写”转为“流式续写”,通过仅在编辑指令到达的 chunk 激活 edit adapter,后续 chunk 由原始流式生成器接续,从根本上避免长期编辑导致的累积漂移。这与现有方法对固定 clip 逐帧对齐的 in-place 编辑形成根本差异;历史锚定和因果时间注意力保证编辑效果能前向外推到新帧,而无需重复注入指令,使得 unbounded 编辑序列也能保持生成质量。
- - 三个注意力模块分工明确,将“过去帧锚定”、“未来时间因果传播”和“指令注入”解耦,是适应流式生成架构的关键设计。History cross-attention 用输入帧提供历史外观约束,temporal causal self-attention 保持单向时间信息流,edit cross-attention 只在特定位置注入编辑信号;相比在每一层都混合所有条件的通用 adapter,这样的轻量解耦减少了对原始生成器分布的扰动,配合 history corruption 与两阶段训练,有效缓解 exposure bias,让编辑在无限长度上更稳定。
方法
方法详解:InfinityEdit 编辑适配器
输入:模型接收一个前序视频段(history frames)和一个编辑指令(edit request),例如风格迁移或镜头运动。输出是下一个视频 chunk,该 chunk 既延续原视频流,又应用了编辑。
关键模块:基于流式生成器 Helios,插入一个轻量级编辑适配器,包含三个注意力模块:
- History Cross-Attention:用历史帧作为 key/value,引导当前去噪帧与已生成内容对齐,避免跳跃;
- Temporal Causal Self-Attention:强制时间因果,信息只能从早期帧流向后期帧,符合流式生成约束;
- Edit Cross-Attention:将编辑指令的 embeddings 注入生成过程,控制编辑方向。
训练策略:采用 flow-matching 目标;通过历史帧破坏(随机丢弃或噪声化历史)缓解曝光偏差;使用混合高斯分布采样噪声级别;两阶段课程学习,先覆盖全局结构再细化细节。
推理流程:编辑请求到达时,仅在该 chunk 激活适配器;后续 chunk 由原始 Helios 模型生成,并重置锚点帧,以保持流式生成的稳定性。
与同类方法不同,InfinityEdit 不是对固定长度输入逐帧重写,而是将编辑能力植入流式生成器,实现真正无界的连续编辑序列,并在多轮编辑中维持质量稳定。
实验
实验设计
论文构建了无限视频编辑任务,设计了数据收集管线生成带编辑指令的流式视频片段。训练时采用流匹配目标,结合历史损坏与混合高斯噪声采样,分两阶段课程训练轻量 edit adapter。评估在 VBench 指标(质量、一致性等)和 VLM-as-Judge 上进行,同时测试多轮编辑的稳定性。
关键发现
InfinityEdit 在每轮编辑请求下均能忠实延续视频流,且生成质量在无限编辑序列上保持稳定。推理时,adapter 仅在编辑到达的 chunk 激活,后续 chunk 由原始流模型生成,并通过 anchor 帧重置保持生成能力。低噪声采样进一步细化细节,历史窗口滑动支持任意长度编辑。
与基线对比解读
与依赖 in-place 编辑的方法(要求帧对齐静态 clip)相比,InfinityEdit 直接处理开放流,不假设固定时间跨度。通过仅激活编辑 chunk 并重置 anchor,避免了常开 adapter 导致的误差累积和生成质量下降。该设计在编辑保真与长期流生成之间取得平衡,优于朴素的全帧改写或持续激活适配器的方案。
行业影响
落地场景
InfinityEdit 面向无限流式视频编辑,特别适合直播增强、实时视频通信与在线内容生成。例如:
- 电商直播:主播无需绿幕,实时替换背景、叠加品牌特效或动态贴纸,增强商品展示。
- 游戏/赛事直播:对实时游戏画面施加风格化滤镜(如卡通渲染)或动态镜头效果,提升观众沉浸感。
- 视频会议/在线教育:持续对摄像头流进行背景模糊、虚拟背景或重点标记,而不中断会话。
商业价值
该技术将视频编辑从离线后处理推向实时流式应用,带来显著降本增效:
- 降低制作成本:无需逐帧后期渲染,编辑随流生成,节省 GPU 和人工剪辑开销。
- 提升用户体验:实时个性化编辑(如滤镜、特效)增加互动性和沉浸感,提高用户留存和付费意愿。
- 开拓新服务:直播平台可提供按次或订阅制的实时编辑特效,形成新的收入来源。
与现有产品/工作流的接口
InfinityEdit 以轻量 adapter 形式插接到流式视频生成器(如 Helios),集成成本低:
- 推理管线:接收流式视频帧和编辑指令,在编辑到达的 chunk 激活 adapter,其余 chunk 走原始模型,保持生成速度。
- 技术栈兼容:可嵌入现有实时视频处理服务(如基于
ffmpeg+ GPU 的 pipeline),作为可选模块。 - 数据闭环:论文提出的数据收集 pipeline 可复用于企业自有场景,通过微调适配特定编辑需求。
该方案尤其适合需要持续、低延迟视频编辑的开放式流媒体业务,例如直播平台或虚拟制作工具链。
局限
- **依赖 base model 流式生成质量**:InfinityEdit 构建在 **Helios** 之上,其编辑效果受 base model 生成能力限制。若 base model 在复杂动态场景或长期生成中出现运动伪影、语义漂移或纹理不连贯,适配器无法根本修正,因为历史 cross-attention 和 anchor 重置策略只能在有限窗口内缓解。在剧烈镜头切换或高速运动等非平稳流中,编辑指令可能无法被稳定执行,导致视频质量快速下降。
- **编辑类型覆盖有限**:数据收集管线依赖预定义的编辑指令生成器与目标视频生成流程,可能偏向可自动标注的编辑类别(如风格迁移、相机运动),难以覆盖开放式或复合编辑指令。这限制了方法在实际场景中的泛化能力,当用户提出新颖或组合编辑请求时,模型可能无法精确理解并执行。此外,训练数据中的编辑指令多样性不足可能导致对某些编辑类型过拟合,影响 zero-shot 表现。
- **长期稳定性仍有上限**:尽管采用 **history-window sliding** 和 **anchor resetting** 来维持无限编辑,但随着编辑回合增加,误差仍可能逐渐累积,导致生成视频偏离原始流内容或编辑语义漂移。论文中的稳定性评估可能仅覆盖有限轮数,缺乏对超长时间(如数十分钟以上)的验证。另外,anchor frame 重置可能引入微小的帧间不连续性,在高质量视频应用或人眼敏感场景下可被察觉,从而限制其工业级应用。