论文

MemLearner: 学习查询视频世界模型的上下文记忆

MemLearner: 学习查询视频世界模型的上下文记忆

视频世界模型是一种交互式视频生成模型,根据用户动作和历史视频帧预测未来世界状态。此类模型面临记忆缺失的关键挑战,导致长时间生成场景不一致。先前方法采用基于规则的上下文帧检索作为记忆,但在场景遮挡和动态物体情境下泛化能力不足。 我们提出 MemLearner,一种基于学习的自适应上下文查询方法,利用 query tokens 连接上下文与预测 token。该方法借助视频生成模型本身进行上下文查询,无需从头训练额外模块即可利用预训练视觉先验,并集成了高效训练与推理策略。我们收集了包含场景遮挡和动态物体的长视频数据集,并配有相机位姿标注,同时提出一种多数据集训练策略,结合标注渲染视频与未标注真实视频。 大量实验表明,MemLearner 在场景一致性和记忆方面显著优于先前视频世界模型,尤其在具有挑战性的遮挡和动态场景下表现突出。

论文精读

TL;DR MemLearner 通过学习查询标记自适应检索历史上下文,赋予视频世界模型长期记忆能力,在遮挡与动态场景下显著提升生成一致性。

问题

视频世界模型 (Video World Models) 的核心挑战是长期记忆的缺失,导致在长序列生成中出现场景不一致,尤其当存在遮挡或动态物体时,过去帧中的关键信息难以被有效保留和利用。

现有方法主要采用基于规则的上下文帧检索(rule-based context frame retrieval),例如固定间隔采样或依赖光流、深度等几何线索来选择过去帧作为记忆。这些硬编码的检索策略无法自适应场景的语义变化:在遮挡发生时,依然机械地抽取被遮挡帧;当动态物体移动,无法追踪其历史外观。规则方法忽略了当前生成内容与历史帧之间的复杂关联,且无法利用预训练视频生成模型内部的视觉先验,导致检索到的记忆帧常为噪声,反而损害生成质量。

该问题的重要性与难度并存:

  1. 技术挑战:学习如何从长距离历史中自动查询相关上下文,需要平衡计算效率与检索精度,同时避免依赖外部标注(如相机位姿)导致泛化受限。
  2. 业界关注度:视频世界模型是通向交互式 AI 的基石,在机器人仿真、自动驾驶模拟、游戏内容生成等场景需求迫切。缺乏鲁棒的记忆机制,模型无法持续产出时序一致的视频,严重制约其在长程任务中的应用。

类比检索增强生成 (RAG) 在语言模型中的角色,MemLearner 通过可学习的查询令牌为视频生成模型插入了动态记忆模块,可视为视频世界的“RAG”方案。

核心洞察

  • 将自适应记忆查询集成到视频生成模型的潜在空间中,避免了额外模块和几何先验的依赖,实现了更鲁棒的长期一致性。传统方法通常通过基于规则的帧检索或独立训练的记忆模块来维护长期记忆,这些方法难以泛化到遮挡严重、动态物体频繁的场景。MemLearner 的核心洞察在于直接利用预训练视频生成模型自身丰富的视觉先验,在潜在空间内引入可学习的 query tokens,让模型根据当前生成状态自动从历史帧中提取最相关的视觉线索。这种端到端的学习方式不需要任何显式的几何信息或手工设计的检索逻辑,从数据中学会了自适应关注关键帧,从而在长时间生成中保持场景稳定和物体连贯。
  • 通过查询策略的工程优化(仅浅层查询、排除冗余计算)实现了高效训练和推理,使得基于学习的记忆机制在实际应用中可行。记忆增强的生成模型通常面临显著的计算开销,MemLearner 深入分析了 query tokens 在 Transformer 各层的作用,发现早期层足以完成上下文信息融合。据此,他们提出仅在浅层(如前几层)注入 query tokens 并执行交叉注意力,同时剪除深层中不必要的计算冗余。这种策略在保持性能的同时大幅降低了延迟与显存占用,为大规模视频世界模型的实时交互式应用提供了关键效率保障,展示了研究性方法与工程部署之间的平衡。

方法

MemLearner 的核心是在预训练视频世界模型中引入可学习的自适应查询令牌 (adaptive query tokens),代替手工规则检索历史帧。

输入→关键模块→输出

  • 输入:当前用户动作编码、近期视频帧序列,以及作为记忆库的远历史帧集合。
  • 关键模块
    1. 查询令牌:在生成模型的 Transformer 层中插入一组可训练的 query tokens。这些令牌通过交叉注意力 (cross-attention) 与历史帧特征交互,自动学习从记忆库中抽取与当前生成最相关的上下文信息。
    2. 高效策略
      • 仅在模型的早期层 (如前半部分) 执行上下文查询,深层沿用标准生成流程,降低计算开销。
      • 推理时裁剪不必要的冗余注意力计算,例如排除对恒定背景区域的密集匹配。
    3. 相机姿态嵌入:对于有标定数据的渲染场景,将相机位姿编码为嵌入,注入查询过程,提升空间一致性。
  • 输出:连贯的未来视频帧预测,即便在遮挡和动态物体干扰下也能保持场景记忆。

训练策略

  • 利用包含标注相机姿态的合成渲染数据集无标注真实视频进行多数据集训练:合成数据培养强大的姿态感知检索能力,真实数据提升泛化性。
  • 整体框架基于预训练视频扩散/自回归模型,仅微调查询令牌及相关交叉注意力层,保留原始生成能力。
    与以往基于固定间隔或手工规则的检索方法不同,MemLearner 将记忆读取内化为学习过程,使模型能够根据内容自适应地选择关键帧,显著提升长时间遮挡下的场景一致性。

实验

实验设计

MemLearner 基于一个特意构造的长视频数据集进行训练和评测,该数据集包含丰富的场景遮挡动态物体交互,并配有精确的相机姿态标注。为了提升泛化性,作者采用多数据集训练策略,同时利用带标注的渲染视频和未标注的真实世界视频(如 SpatialVIDEpic-Kitchens)。实验框架覆盖了定性对比定量指标用户研究零样本迁移以及系统的消融实验(注意力计算方式、查询层数、相机嵌入、数据集组成)。推理阶段进一步引入两种高效策略:① 仅在扩散模型的早期层执行上下文查询;② 剪除与上下文无关的冗余计算,从而在几乎不增加延迟的情况下注入记忆能力。

关键发现

  • 长期画面一致性记忆保持上,MemLearner 显著超越所有基线,尤其在严重遮挡动态对象场景中优势更为突出。
  • 学习到的自适应查询 token 能够跨时间步和视频帧动态聚合关键上下文,完全取代了传统的硬编码检索规则。
  • 直接将查询机制嵌入视频生成模型内部,复用预训练视觉先验,避免单独训练查询模块导致的性能退化(附录中的独立模块实验证实了这一点)。
  • 消融实验表明:在早期层注入查询(而非全部层)、融入相机姿态嵌入以及多数据集联合训练都是取得高性能的关键要素。
  • 用户研究反馈显示,MemLearner 生成的视频在视觉连贯性运动合理性上更符合人类预期。

与基线对比的深度解读

传统的记忆机制大多依赖基于规则的上下文检索,例如固定间隔采样或几何匹配。这类方法在遇到遮挡或前景动态物体时,极易错误地拉取无关帧,导致画面突变。MemLearner 通过注意力引导的软检索,在潜在空间中自适应融合历史信息,动态适应场景内容的变化,因此能生成更为稳定一致的未来帧。额外对比实验进一步揭示,将查询模块独立于生成模型进行训练再挂接,其效果远逊于本工作中端到端一体化学习的方式——这有力证明了利用生成模型内部强大表征进行记忆查询的优越性。从工程角度,MemLearner 的思路适用于其他视频生成架构,且推理开销可控,对实际部署具有直接参考价值。

行业影响

落地场景

MemLearner 的核心能力是增强视频世界模型的长期记忆与场景一致性,这直接面向交互式视频生成长序列仿真动态内容编辑三大方向。具体可落地的产品/业务包括:

  • 虚拟环境构建与游戏开发:在开放世界游戏或数字孪生中,根据玩家操作实时生成连续、一致的场景,避免因遮挡或动态物体导致画面突变。
  • 增强现实(AR)/虚拟现实(VR)内容创作:在沉浸式体验中,用户视角变化时,系统能记忆已生成的背景区域,实现无缝回看。
  • 自动驾驶仿真:为感知模型生成包含长时间遮挡、动态车辆/行人的驾驶场景,提升训练数据的真实性与覆盖度。
  • 视频编辑与特效工具:在插入或移除动态物体时,自动补全被遮挡的背景信息,保持画面连贯。

商业价值

降本:现有长视频生成常需人工逐帧修正或多次重跑,MemLearner 通过自适应记忆机制大幅减少重生成比例,降低计算与人工成本。尤其在需要批量产出合成数据的仿真、内容平台场景,直接削减 GPU 时耗与人力投入。

增收:在交互式应用(如虚拟试穿、个性化广告生成)中,更高的画面一致性直接提升用户体验,延长使用时长,带动转化率与付费意愿。

体验提升:对于需要长期依赖关系的视频内容(如教程视频中的连续操作演示、虚拟主播直播),记忆能力可避免物体突然消失或背景错位,增强内容可信度。

与现有产品/工作流的接口

MemLearner 以查询令牌(query tokens)的形式插入预训练视频生成模型(如扩散 Transformer 或自回归模型),无需修改原模型基础权重,可即插即用。集成路径包括:

  1. 微调阶段:在已有 text-to-video 模型上添加轻量级查询模块,使用多数据集策略(带标注的合成数据 + 无标注的真实视频)进行训练,快速赋予记忆能力。
  2. 推理阶段:查询仅作用于早期网络层,且可排除冗余计算,对推理延迟影响可控,便于嵌入实时交互流水线。
  3. 数据管线:可利用自采集的带有遮挡、动态物体和相机位姿标注的数据集,或直接利用真实场景视频,降低对精确标注的依赖。

具体落地 Use Case

  • 电商虚拟试穿/家居展示:用户拖拽商品在某场景中移动,背景中部分区域被遮挡后需要重新展现。MemLearner 可记忆被遮挡的背景纹理,在商品移开后无缝还原,避免出现空白或模糊补丁。此类功能可集成至电商平台的 3D 预览模块,提升线上体验的沉浸感与转化率。
  • 自动驾驶感知模型训练数据生成:利用模拟器生成包含动态车辆和行人的驾驶视频时,常出现因遮挡导致的路牌、建筑突然消失或变形。引入 MemLearner 后,仿真系统能在被遮挡物体再次出现时保持其外观一致,产生更贴合真实分布的合成数据,进而提高下游检测、跟踪模型的泛化能力,减少实车路测的频次和成本。

局限

  • 训练依赖带相机姿态标注的数据集,尽管多数据集策略融合了无标注真实视频,但渲染场景仍不可或缺。这增加了数据采集成本,并限制了在完全无监督真实场景下的直接应用,对大规模真实世界部署构成障碍。
  • 方法以特定的文本到视频生成基座模型(DiT 架构)为基础,查询 token 机制与模型注意力层紧密耦合。若迁移至其他视频生成架构(如基于 UNet 或自回归模型),需重新设计查询插入位置与交互方式,架构泛化能力尚未验证。
论文Jiwen Yu2026-06-30原文

相关内容