论文

Memorizon: 在上下文窗口之外训练世界模型

Memorizon: 在上下文窗口之外训练世界模型

流式世界模型应当在重复到访同一地点时给出一致的渲染。直接监督这类重访,需要同时包含两次到访的训练样本,跨度常达数分钟;而对完整跨度做稠密注意力会带来二次开销,使长跨度监督代价高昂。 Memorizon 解开了这一耦合:监督需要长跨度,但注意力不需要,因为两次到访可以共享一次前向传播,而无需包含其间的每一帧。 - 一个训练样本可覆盖任意长度的跨度,但只在最后 k 个 chunk 上计分。 - 不对此前历史做 tokenize,而是让每个被计分的 chunk 依据相机共可见性检索自己的 top-K latent,这些请求的并集构成一个共享 bank。 - bank 规模被限定在 kK,因此无论跨度多长序列长度都有界;在最短跨度下,该方案恰好等价于常规训练。 加入 bank 只会让单步成本上升一次;此后更长的跨度代价很小,从 100 秒增至 400 秒仅使单步时间增加 12%。相比滑动窗口基线,检索在所有 split 上都提升了重访一致性;当跨度长到足以覆盖每次返回的首次到访时,还能再提升 24% 至 30%,代价是图像质量有所下降,而超过该跨度后继续加长不再有收益。若改用另一 episode 填充 bank,重访相关性下降 83%,说明模型确实在使用检索到的内容。项目页面:https://tingtingliao.github.io/memorizon

论文精读

TL;DR Memorizon 通过检索式记忆银行解耦长跨度监督与注意力:训练样本跨分钟,但注意力只在相机共可见的 top-K latents 上,序列有界、成本低,让世界模型超越上下文窗口保持重访一致性。

问题

问题背景

流式世界模型(streaming world models)需要在长时间跨度上保持场景记忆,尤其是重复访问同一地点时渲染结果应保持一致。当前领域关注如何以可承受的计算成本训练具备长期空间一致性的视频生成模型。

现有方法局限

直接监督重访一致性要求训练样本同时覆盖两次访问,时间跨度常达数分钟。密集注意力(dense attention)在完整跨度上产生二次方计算成本,使长跨度监督极为昂贵。常见做法与局限包括:

  • sliding-window attention:只保留最近一段 token 作为上下文,超出窗口的早期访问信息完全丢失,模型无法学习重访一致性。
  • memory-augmented methods:检索线索(如时间邻近性)难以匹配空间重访场景,缓存容量有限,长期依赖仍被截断。

为什么这个问题难且重要

核心难点在于解耦“监督所需的长跨度”与“注意力可承受的短跨度”。长跨度监督要求模型看到早期的访问帧,但将所有中间帧纳入注意力会导致序列长度线性增长,计算开销无法接受。业界对具身智能、自主导航和视频生成中的时间一致性高度关注,但缺乏一种能在训练时注入远距离空间记忆、同时保持序列长度有界的方案。Memorizon 提出的按相机共视(camera co-visibility)检索 top-K latents 的方式,将记忆库大小限制为 kK,与跨度长度无关,为这一方向提供了新思路。

行业类比

类似自动驾驶车辆重新经过同一路口时,系统需要调用之前存储的该地点动态与静态特征,而不是回放整个历史轨迹;这要求按需检索相关记忆,与 Memorizon 的记忆库机制高度契合。

核心洞察

  • Memorizon 的核心洞察是将长跨度的监督需求与注意力计算解耦:训练样本可以覆盖任意长度,但模型仅对最后 k 个 chunk 评分,历史信息通过按需检索组成有界 memory bank,而非全部参与注意力。这打破了以往流式世界模型必须在上下文长度与长时一致性之间权衡的限制。与直接扩展上下文窗口或滑动窗口的 baseline 相比,Memorizon 在保持序列长度有界(bounded by kK)的同时,获得了长时重访监督,使训练跨度从 100s 增加到 400s 仅增加 12% 步时,为大规模长程世界模型训练提供了可行的效率路径。
  • 有界检索 bank 的设计使训练成本与 span 长度近似解耦,并通过跨 episode 实验证明模型真正依赖检索内容而非无关记忆。具体而言,每个评分 chunk 依据相机共视性检索 top-K latents,所有请求的并集构成 bank,其容量上限为 k·K,与训练 span 长度无关。因此,任意长的 span 都不会增加注意力序列长度,成本仅由最后 k 个 chunk 和 bank 大小决定。实验显示,用另一个 episode 填充 bank 会导致重访相关性下降 83%,表明模型确实利用了检索到的几何相关 latent 而非仅仅依赖位置编码或全局上下文,这为其他高效长序列建模提供了可借鉴的设计思路。

方法

输入与样本构造

Memorizon 接收长跨度视频序列,按固定长度划分为多个 chunk,每个 chunk 附带相机位姿。训练样本覆盖任意时间跨度,但仅对最后 k 个 chunk 计算损失;前文只作为可检索的历史,不直接参与前向。

关键模块:Per-Chunk Retrieval 与 Memory Bank

  1. 相机共视性检索:每个待评分的 chunk 根据相机位姿计算与历史帧的 frustum overlap,检索出共视度最高的 top-K 个 latent。
  2. 共享 bank 构造:所有 scored chunk 的检索请求取并集,构成一个共享 memory bank。bank 大小上界为 kK,与总跨度无关。
  3. 注意力机制:当前 chunk 与 bank 中的 latent 一起送入 Transformer,使用 causal sliding window 保持因果性,并引入 attention sink 作为全局可访问 token;bank 内 latent 按 RoPE index 编码位置。当训练跨度最短时,bank 为空,整个流程退化为常规滑动窗口训练。

输出与训练目标

模型输出对当前 chunk 的重建或预测结果,优化目标为重建/预测损失(原文未列明具体形式)。此外,通过 蒸馏 强化检索 latent 的表达稳定性,并采用 ground-truth 评估指标来验证检索准则的有效性。

与同类方法的差异

Memorizon 与 dense attention 或固定长度滑动窗口不同,它用检索式 memory bank 将长跨度监督与长序列注意力解耦:监督可以跨越分钟级时间,但注意力序列长度始终有界,因此长跨度训练成本几乎不随跨度线性增长。

实验

实验设计

Memorizon 在自监督视频世界模型任务上评估,训练样本覆盖任意长 span,但仅对最后 k 个 chunk 计分。每个 chunk 根据相机共视性检索 top-K latents 形成共享 memory bank,bank 大小上限 kK。对比基线为常规滑动窗口注意力。评估指标包括 revisit consistency(重复访问一致性)、图像质量等,并在多个数据集切分上测试。

关键发现

  1. 检索机制相对于滑动窗口基线在所有切分上提升 revisit consistency。
  2. 将训练 span 延长至能覆盖每个 return 的首次访问,在检索基础上额外带来 24%-30% 的一致性提升,但图像质量略有下降。
  3. 继续增加 span 不再带来收益。
  4. 用其他 episode 填充 bank 导致 revisit correlation 下降 83%,证明模型确实利用检索内容。
  5. 效率上,bank 引入的一次性成本之外,延长 span 从 100s 到 400s 仅增加 12% 步时。

基线对比解读

与传统滑动窗口有限上下文不同,Memorizon 通过 co-visibility 检索打破注意力长度与监督 span 的耦合。滑动窗口受限于窗口大小,跨长时间重访无法直接监督;Memorizon 在保持序列长度有界的同时,允许模型从长历史中检索相关 latent,实现显式长期记忆。该设计类似于 retrieval-augmented generation 的思路,但针对流式视频世界模型,且 bank 共享机制保持线性成本增长。

行业影响

落地场景

Memorizon 的训练机制适用于需要长期空间记忆的流式世界模型,典型场景包括:

  • 自动驾驶 / 机器人仿真:车辆或机器人多次巡逻同一区域时,需要模型对关键地标保持一致的渲染和预测,而非每次重新推理造成漂移。
  • 电商虚拟展厅 / 数字孪生:用户在虚拟空间中多次进入同一店铺或展厅,要求商品位置、光照、遮挡关系跨 session 一致。
  • 内容平台交互式视频 / 虚拟主播:长时生成的场景需要角色返回旧地点时环境不变。

商业价值

核心价值在训练成本与长时一致性的平衡:长跨度监督不再承担 quadratic attention 成本,从 100 s 到 400 s 步时仅增加 12%,使长时 world model 训练从不可行变为可行。这直接降低 GPU 成本,同时提升用户体验——重访一致性指标在各 split 上均上升,减少闪烁和内容错乱,增强产品可信度。对需要持久世界状态的 SaaS 或仿真服务,是同成本下更长的有效记忆。

与现有工作流集成

该方法可作为现有 video world model 训练栈的插件:保留 backbone 和 sliding-window attention,增加 memory bank 和 per-chunk retrieval,bank 大小由 k*K 有界,无需改动推理时的 KV cache 结构。检索基于 camera co-visibility 可离线预处理,因此可直接嵌入 PyTorch 训练循环。开源代码见 GitHub,项目页 Memorizon 提供实现细节。对已有 diffusion transformer 或 autoregressive video model,只需替换 attention 输入构造即可增量迁移。

局限

  • 摘要明确指出训练跨度增加会带来图像质量的下降。该方法在提升重访一致性的同时,以一定的保真度损失为代价,可能源于记忆检索引入的隐变量压缩/量化误差,或长跨度监督与重建目标之间的优化冲突。在需要高质量渲染的应用(如逼真环境模拟)中,这一权衡可能限制其直接使用。
  • 检索机制依赖相机共视性来选取 top-K latents,这意味着相机姿态估计和场景几何信息的准确性至关重要。在动态场景、严重遮挡或姿态噪声较大的数据上,共视性计算可能失效,导致检索到无关历史帧,损害一致性。附录中提及的 retrieval cues failure modes 和 scale sensitivity 也印证了这一点,说明该方法对输入质量敏感。
  • 实验主要与滑动窗口 baseline 对比,未涵盖近期的线性注意力、状态空间模型或其他 memory transformer 变体。记忆库容量虽受 kK 约束,但检索操作在推理时增加了额外计算与内存访问,实际开销未充分评估。此外,跨 episode 填充记忆库使重访相关性下降 83%,表明跨场景泛化能力有限。
论文Tingting Liao2026-09-30原文

相关内容