LOCI:面向流式世界模型的空间线性记忆
当相机重新访问此前观察过的区域时,视频世界模型应当能重现那里的内容。这既要求记住过去的观测,也要求针对当前视角检索出正确的观测。Key-value 缓存 能保留视觉细节,但随视频长度增长;循环记忆紧凑,却把历史压缩进固定大小的状态,使单个过去的观测不再可直接访问。 LOCI 是一种混合空间记忆架构,同时保留上述两种表示。在一半 transformer block 中,主注意力保留过去观测的 key-value 缓存;在另一半中,注意力被限制在当前 chunk 内,并由一个循环线性注意力记忆补足——该记忆的读写都以 投影相机几何 为条件,使视角同时进入记忆寻址与存储内容。循环读出会流入后续由缓存支撑的 block,并为其 query 提供累积的场景上下文。 在公开的 MIND 记忆基准与留存的录制轨迹上,LOCI 重现重访内容比代表性世界模型和同配方的 full-softmax 模型更忠实;在完整历史下,等长时相较 full softmax 将峰值内存降低约 30%。在受限的保留观测库下,它能以恒定内存流式处理长视频,并在相同预算内仍比 full softmax 更忠实。
论文精读
TL;DR LOCI 混合空间记忆世界模型:KV 缓存保留细节,相机几何条件的循环线性注意力压缩历史,重访更忠实且峰值内存降约 30%。
问题
问题背景
视频世界模型(video world models)正从短片段生成走向流式长视频建模,核心诉求是相机在场景中移动并重访已观测区域时,模型能准确再现历史内容,同时保持内存可控。
现有方法局限
- 全softmax注意力 + KV缓存:可精确保存历史 token 的键值对,提供高保真检索;但缓存大小随视频长度线性增长,流式推理中内存无上限,无法用于长时程或资源受限场景。
- 循环记忆 / 状态空间模型(如线性注意力、Mamba):将历史压缩为固定尺寸状态,内存恒定;然而压缩后的状态丢失了空间可寻址性,个体历史观测不再直接可访问,重访时只能依赖全局摘要,导致细节模糊或错误。
- 已有混合架构:部分模型尝试结合两种记忆,但未显式把投影相机几何注入记忆读写,导致视角变化下检索错位。
为什么这个问题难且重要
- 技术难点在于空间记忆的双重约束:既要长期保留视觉细节(高容量),又要在正确时刻检索正确位置的内容(高精度寻址);纯缓存和纯压缩都只满足其一。
- 业界关注度:自动驾驶、AR/VR、具身智能等需要持续运行的流式世界模型,模型必须在不增加设备内存的前提下,对场景重访保持一致性;这是产品落地的关键瓶颈。
- 工程启示:设计混合记忆需要区分稠密历史访问与稀疏有界历史,例如将部分层保留缓存、部分层使用循环线性注意力,并让相机姿态参与寻址。
行业类比
类似自动驾驶车辆行驶数小时后返回先前路口,系统需精确回忆当时的临时路障或行人位置,而不是只记得“那里曾经有东西”的语义摘要。
核心洞察
- LOCI 的核心洞察是用混合记忆解决流式世界模型的重访保真度问题:一半 block 保留 KV cache 捕捉近期细节,另一半 block 用受相机几何条件调控的循环线性注意力压缩全局历史。这比纯循环模型多保留了可检索的视觉细节,又比全 softmax 模型避免了显存随视频长度线性增长。
- 将投影相机几何同时注入循环记忆的读写与存储内容,使视角本身成为记忆寻址的一部分。这不同于已有工作仅把相机参数用作位置编码;LOCI 的循环状态可被相机解码,历史注意力集中在共可见内容上,从而在固定内存预算下长视频重访更忠实。
方法
输入与任务定义
LOCI 面向流式视频世界模型:输入为 RGB 视频帧序列与投影相机几何(内外参 / 光线方向),模型需在相机重访已观测区域时,从历史记忆中检索并再现对应的视觉内容。
核心模块:混合记忆架构
LOCI 的 backbone 由交替的 transformer 块组成:
- Cache-backed 块(约一半):主注意力保留全历史 KV cache,提供细粒度视觉细节,但内存随帧数线性增长。
- Recurrent 块(另一半):将注意力限制在当前 chunk,并接入一个循环线性注意力记忆,其状态大小固定,通过读出(readout)向后续 cache-backed 块的 query 注入累积场景上下文。
相机条件化与记忆动态
循环记忆的读写均以投影相机编码为条件:将每帧的相机射线方向、坐标等几何信息投影到高维特征,用于调制记忆的地址(write 时的键)与内容(value),使记忆具备视角感知能力。记忆更新采用 chunk-synchronous 策略:
- 读取:从上一 chunk 的状态读取出上下文。
- 写入:在当前 chunk 内以 token 分辨率更新记忆。
- 保留(retention):每个 chunk 只执行一次状态压缩,而非每 token 一次,降低计算开销。
输出与流式推理
最终输出为重建/预测的视频帧,重访区域的保真度通过循环记忆与稀疏 KV 银行协同保证:当内存受限时,可启用有界观测银行(保留最近或最相关的帧),在恒定内存下流式处理长视频。
与同类方法的差异点:LOCI 首次将投影相机几何显式条件化引入循环线性注意力记忆,实现空间可寻址的流式历史访问,而非简单堆叠 RNN 与 cache。
实验
实验设计
论文在 MIND 记忆基准和 held-out recorded trajectories 上评估 LOCI。核心任务是对相机重新访问区域的视觉重现。对比对象包括代表性世界模型、同配方 full-softmax 模型,以及消融中分离 hybrid 与 dense/sparse 历史访问的影响。评估维度覆盖短时回访一致性、长程生成质量、峰值内存与流式处理下的恒定内存表现。
关键发现
- LOCI 在回访内容重现上超过代表性世界模型和同配方 full-softmax 基线。
- 在保持完整历史的情况下,LOCI 将等长序列的峰值内存降低约 30%。
- 使用有界保留观测库时,LOCI 可在恒定内存下流式处理长视频,且同预算下仍优于 full-softmax。
- 投影相机条件使循环状态可解码相机参数;历史注意力集中到共视内容。
对比解读
full-softmax 直接保留 KV cache,虽然视觉细节保真,但内存随视频长度线性增长; recurrent memory 压缩历史但丢失个体观测。LOCI 的混合设计在 cost 与 fidelity 间取得平衡:递归分支通过相机条件读写定位内容,减少对全局 KV 的依赖,从而降低峰值内存;而稀疏历史库避免无限增长。对工程实现而言,若部署流式世界模型,LOCI 的恒定内存特性意味着可以在长视频推理中稳定占用 GPU 显存;但需要额外实现基于相机几何的读写索引与 chunk 同步状态更新,增加推理框架复杂度。
行业影响
落地场景
LOCI 面向需要长程空间记忆的流式世界模型,适合以下场景:
- 自动驾驶仿真:车辆长距离行驶中回访之前经过的路段,世界模型需要重现环境细节;
LOCI以恒定内存支持流式推理。 - AR/VR 空间计算:用户移动后返回原位置,虚拟内容需与历史观测对齐,
LOCI混合记忆可保留可检索的过去观测。 - 长视频生成:角色 / 场景在长序列中反复出现,需要记忆与检索。
商业价值
- 降本:满历史时峰值内存较全 softmax 降低约 30%,同等硬件支持更长序列或更大 batch;有界内存下可流式处理长视频而内存不增长。
- 体验提升:重访区域内容重现值比同预算全 softmax 更忠实,减少视觉漂移。
- 实时性:恒定内存和高效线性注意力适合边缘设备与实时应用。
接口集成
LOCI 可作为模块嵌入现有 transformer 视频模型:
- 将一半注意力块替换为带相机条件循环线性记忆的块,保留另一半 KV cache;
- 相机条件可利用现有相机标定或 SfM 结果,无需额外标注;
- 支持训练后转换与每 chunk 一次保留策略,与现有训练管道兼容。
具体 use case:电商虚拟试穿中,用户旋转视角需保持商品细节一致;远程协作 AR 标注中,专家视角回访时需重现之前标记。两者均可采用 LOCI 降低内存并提升一致性。
局限
- **依赖相机几何信息与静态场景假设**:LOCI 将投影相机编码注入 recurrent memory 的读写与内容存储,这要求每帧都有可靠的相机位姿/内外参。对于无姿态标注的真实视频(如手持拍摄、互联网视频),需要额外估计相机轨迹,估计误差会直接影响记忆寻址与读出的准确度。此外,方法主要面向静态或准静态场景的重访(如导航),对场景内显著运动、动态物体或大幅光照变化缺乏显式建模,限制了其在开放世界视频生成中的应用范围。
- **训练策略可能依赖从 full softmax 的转换初始化**:论文在 ablation 中对比了 direct training 与 conversion,虽然结论未知,但若直接训练混合架构存在优化困难或不稳定,那么实际部署时需要先训练一个高成本的 full softmax 模型再转换,增加训练流程复杂性和算力门槛。同时,recurrent linear attention 分支的读写门控与相机条件化模块增加了参数量和计算图复杂度,可能带来额外的推理延迟,论文对吞吐(tokens/s)的对比不够充分,工程落地时需权衡内存收益与计算开销。
- **有界记忆库的长期一致性仍受限**:当采用 bounded bank of retained observations 进行恒定内存流式推理时,模型必须选择保留哪些历史帧。摘要提到在相同预算下比 full softmax 更忠实,但任何有界缓存策略在超长视频中都会面临缓存替换的 challenge。论文没有详细讨论 bank 选择策略的泛化性和敏感性,例如随机丢弃 vs 基于几何的保留可能在不同场景下影响重访质量,且模型在极长时间跨度下的记忆衰减(对于非常远的历史)未充分评估。