论文

LayerRecall: 面向视频生成中长程一致性的状态条件记忆路由器

LayerRecall: 面向视频生成中长程一致性的状态条件记忆路由器

自回归视频扩散通过从有界近期上下文生成块来实现可扩展的长视频生成。基于近期缓存的机制保持局部连续性,但会驱逐在主体、物体、场景或属性重新出现时所需的历史线索。现有记忆机制将模型暴露于非局部历史,但仅访问并不能确保有效使用。我们的分析显示,视频 DiT 层对当前、近期和远期上下文表现出不同偏好,表明长程记忆需要同时决定检索什么以及在哪里使用。 我们提出 LayerRecall,一种基于当前状态、层选择的记忆路由器,它检索相关的历史 K/V 状态,并仅将其实注入骨干特定的记忆敏感层,同时在其他层保留局部注意力。为了减少对稀缺的高质量长视频和显式记忆分配标签的依赖,我们还提出 跨视野预测匹配(CHPM),它在预测空间中使用特权长上下文参考来监督有界记忆路由器。 在 100 个多镜头评估提示中,LayerRecall 在 MemoBench 和 MovieBench 上取得了最佳整体结果,同时在 VBench-Long 上与其骨干匹配,展示了更强的长程恢复能力而不牺牲局部连续性。定性分析进一步揭示了记忆引导的自我校正,即最初不匹配的局部属性回到其历史外观,而无需重置正在进行的运动或场景结构。额外分析显示了跨骨干可移植性和可忽略的推理开销。

论文精读

TL;DR LayerRecall 用状态条件记忆路由器,将历史 K/V 状态选择性注入视频 DiT 的记忆敏感层,实现长视频跨镜头一致性,在 MemoBench / MovieBench 上超越基线且不牺牲局部连续性。

问题

问题背景

自回归视频扩散模型通过分块生成实现可扩展长视频,但受限于有界最近上下文。为维持局部连续性,模型通常采用近期缓存,但历史线索(如主体、物体、场景、属性重现)会被逐出窗口。

现有方法局限

已有记忆机制尝试将非局部历史暴露给模型,但“可访问”不等于“有效利用”。作者分析发现 video DiT 不同层对当前、近期、远期上下文存在显著偏好差异:某些层专注于局部运动,注入远期记忆反而干扰;另一些层则需要历史语义才能恢复远距离一致性。然而现有方法要么在所有层统一注入记忆,要么依赖显式记忆分配标签,导致训练受限于稀缺的高质量长视频数据,难以规模化。

为什么这个问题难/重要

长视频一致性不仅是时间上的 token 匹配,还涉及记忆路由的层级选择——何时检索、检索什么、注入到哪一层。同时,缺乏显式监督使模型难以学会何时依赖历史而非当前上下文。业界对长视频生成的需求(如虚拟主播、影视预演、游戏剧情自动生成)快速增长,但现有模型常出现“身份漂移”或场景断裂,直接限制可用性。

行业类比

LayerRecall 的做法类似推荐系统中的“召回-精排-投放”分层策略:不把所有历史信息一股脑塞给所有模块,而是根据当前状态动态决定哪些记忆对哪些层有用,从而在不牺牲局部流畅度的前提下恢复远距离一致性。

核心洞察

  • LayerRecall 的核心创新在于识别出视频扩散 Transformer 不同层对上下文时间范围的偏好差异,并提出层级选择性记忆路由,只向记忆敏感层注入检索到的历史 K/V 状态。这与以往均匀注入历史信息或全局修改注意力机制的做法不同,能在不破坏局部连续性的前提下恢复长程一致性,同时推理开销可忽略。
  • CHPM 训练策略利用特权长上下文参考在预测空间进行匹配,消除了对显式记忆分配标签和高成本长视频数据的依赖。这种弱监督方式通过蒸馏使有限记忆路由器从教师模型中学习何时何地检索历史,比传统基于规则或启发式的记忆选择更灵活、更可扩展。
  • 模型展示出记忆引导的自校正行为:当局部属性初始生成不一致时,模型能够参考历史记忆自动修正,而无需重置当前运动或场景结构。这暗示 LayerRecall 的记忆注入实现了动态的、非破坏性的状态恢复,对实际长视频生成流水线具有重要工程意义。

方法

输入为自回归视频扩散模型的当前 chunk 特征与历史 K/V 缓存。系统包含三个核心模块:

1. 当前条件历史检索(What to Retrieve)

路由器 以当前生成状态为条件,从历史 K/V 状态中检索相关内容。通过分析视频 DiT 各层对 current、recent、distant context 的偏好差异,路由器学习选择性地聚合历史信息,而非简单堆叠全部历史。检索方式支持硬检索(离散选择)与软检索(加权融合),兼顾效率与表达力。

2. 层选择性记忆注入(Where to Use)

预先通过层剖析确定记忆敏感层。在这些层中,检索到的历史 K/V 状态被注入到自注意力计算中;其余层保持原始局部注意力,避免干扰短期连续性。该策略使长程记忆只在需要时生效。

3. Cross-Horizon Prediction Matching(CHPM)

训练时引入一个拥有特权长上下文的参考模型,与有限记忆路由器在预测空间进行匹配监督。这一设计绕过了对显式记忆分配标签的依赖,缓解了高质量长时视频数据稀缺问题。

输出为记忆增强的预测结果,在长程属性恢复与局部运动连贯之间取得平衡。

差异点:现有记忆机制通常只提供非本地历史访问,不解决“在哪里使用”;LayerRecall 通过层选择性注入,确保记忆只在关键层生效,这是核心区别。

实验

实验设计

  • 在 100 条多镜头提示词上评测,覆盖 MemoBench、MovieBench(长时一致性)与 VBench-Long(局部连续性)。
  • 对比现有记忆增强视频生成基线,并做消融:层选择性路由、CHPM、路由 profile 策略、跨骨干移植、推理开销。
  • 分析视频 DiT 不同层对当前/近期/远期上下文的偏好,定位记忆敏感层。

关键发现

  • 视频 DiT 层对上下文窗口有显著分工:部分层偏好远期历史,部分偏好近期;仅暴露历史不够,需在正确层注入。
  • LayerRecall 在 MemoBench 与 MovieBench 取得最佳综合结果,在 VBench-Long 上与骨干持平,证明长程恢复不牺牲局部连续性。
  • 记忆引导的自校正现象:初始局部属性错误会恢复为历史外观,同时保留运动与场景结构。
  • CHPM 利用高上下文参考在预测空间监督有限记忆路由器,减少对长视频和显式记忆标签的依赖。
  • 跨骨干移植可行,推理开销可忽略。

与基线对比

  • 现有记忆机制(如全层注入或近期缓存)未能按层区分使用历史,导致信息被稀释或位置不当;LayerRecall 通过 当前条件检索 + 层选择注入 精准投放,取得一致性与效率的更好平衡。
  • 相比仅访问非局部历史的基线,LayerRecall 的层感知路由在长程重现实体/场景时更稳定,且无额外推理负担。

行业影响

落地场景

LayerRecall 主要解决自回归视频生成中长时一致性不足的问题,适合需要多镜头、长时间连续生成的场景。典型应用包括:

  • 电商产品视频生成:同一商品在不同镜头、不同背景中保持外观、颜色、Logo 不变,用于自动生成商品详情页视频或广告素材。
  • 影视/动画预演:角色在长镜头或多机位切换中保持服装、发型、面部特征一致,降低后期修正成本。
  • 虚拟人/数字人内容:长对话、多段视频中虚拟形象保持一致,用于虚拟主播、在线教育等。

商业价值

LayerRecall 通过在 K/V 状态 层面路由历史记忆,提升了长视频生成的一致性,直接减少人工修复工作量,降低制作成本。其推理开销小,可快速部署到现有视频生成服务中,帮助内容平台扩大自动化视频产能。对于需要批量生成高质量视频的企业,质量提升意味着更好的用户体验和更高的广告转化率。

与现有工作流集成

LayerRecall 设计为即插即用模块,可集成到基于 DiT 的自回归视频扩散模型中:

  • 保持骨干网络不变,仅训练轻量 路由器和记忆注入层,无需重新训练大规模模型。
  • 复用已有的 K/V 缓存 推理框架,通过额外参数控制历史状态读取。
  • 可通过适配层接入现有视频生成 API 或模型服务,对上层应用透明。

具体案例:某电商平台使用自回归视频扩散模型生成多角度产品展示视频,通过接入 LayerRecall,自动保持产品外观一致性,省去后期人工校准,生成合格率显著提升。

局限

  • 训练仍依赖特权长上下文参考:CHPM 虽然减少了对显式记忆分配标签的需求,但需要额外的长上下文视频作为监督信号,这在实际数据构建中依然稀缺且成本较高。训练时需配对短上下文 rollouts 与长上下文参考,增加了数据管线和计算开销。此外,CHPM 在预测空间进行匹配,可能无法完全捕捉低层特征层面的记忆一致性,对于长时依赖的细粒度恢复效果仍有不确定性。
  • 层选择策略基于静态 profiling:LayerRecall 通过预先分析 backbone 各层对 current/recent/distant context 的偏好来确定注入位置,该策略在训练后固定。然而视频内容动态变化,不同时间步或不同场景下层的重要性可能漂移,静态策略可能无法充分适应复杂长视频。虽然展示了跨 backbone 可移植性,但新架构仍需重新 profiling 和策略选择,工程部署时带来额外步骤与调整成本。
  • 评估规模与指标局限:实验仅在 100 个多镜头 prompts 上测试,样本量较小,且偏重于主体/物体重现类一致性任务,对更复杂的叙事连贯性、多主体交互、场景切换或超长视频(数分钟以上)的泛化能力尚未充分验证。自动化指标如 VBench-Long、MemoBench 可能无法完全反映真实用户对长时一致性的主观感知,缺少大规模人类评估,限制了结论的外部有效性。
论文Yixuan Ding2026-08-28原文

相关内容