HLA-WM:面向长时程视频世界模型的混合线性注意力
长时程视频世界模型 需要持久记忆,以在长时间 rollout 中维持场景一致性。Softmax attention 依靠不断增长的 KV cache 保留完整生成历史,而 recurrent linear attention 将历史压缩为固定大小状态,内存开销显著更低。但我们发现 Gated DeltaNet (GDN) 存在严重的 长程遗忘:来自遥远但相关场景的信息会被后续状态更新逐步衰减。与 full KV caching 相比,HLA-WM 在 60 秒上下文下将历史状态内存减少 12 倍,推理吞吐最多仅下降 1.6%。 为突破这一限制,我们提出 HLA-WM,一个免训练的混合线性注意力框架,把粗粒度几何引导检索与细粒度循环线性状态计算结合起来:利用 GDN 的仿射结构缓存紧凑的 chunk 级转移摘要,借助相机几何检索与场景相关的历史 chunk,再将其重组为查询特定的循环状态。 实验方面: - 在 60 秒的 SANA-WM-Bench 上,HLA-WM 无需额外训练即提升基础自回归生成器全部六项 revisit-consistency 与相机控制指标,包括 0.74 dB PSNR 增益与旋转误差降低 28.5%。 - 改进在下游 refinement 后依然保持,并泛化到 MBench-A:在 547 个样本、全部四个子集与所有评测推理模式下,三项 revisit-consistency 指标均一致提升。 这些结果表明,可选择性寻址的循环记忆能够提升长程场景回忆能力,同时保留 GDN 的效率优势。项目主页:https://caesarhhh.github.io/hla-wm/
论文精读
TL;DR 针对长时域视频世界模型,HLA-WM 以训练无关方式结合几何引导检索与 GDN 循环状态重组,在 SANA-WM-Bench 上无训练提升 PSNR 0.74 dB、旋转误差降 28.5%,同时减少 12 倍历史状态内存,吞吐仅降 1.6%。
问题
问题背景
长时程视频世界模型需要持久记忆来维持场景一致性,例如在长时间导航或操作任务中,模型必须记住之前见过的房间布局或物体位置。
现有方法局限
- Softmax 注意力 通过不断增长的 KV cache 保留完整历史,显存随生成长度线性增长,难以扩展到分钟级视频。
- 循环线性注意力(如 Gated DeltaNet,GDN)将历史压缩为固定大小状态,显存占用大幅降低,但作者发现其存在严重的长程遗忘:远处相关场景的信息被后续状态更新逐步衰减覆盖,导致重访场景时无法准确恢复细节。
- 由于状态是压缩且不可寻址的,模型缺乏机制选择性地召回与当前查询相关的那部分历史,只能依赖全局累积,不适合需要精确场景回顾的任务。
为什么这个问题难/重要
- 技术挑战:需要在固定大小的循环状态中实现 可寻址的记忆 与 选择性重组,同时不牺牲高效的线性注意力计算,且不引入额外训练。
- 业界关注度:长视频生成、自动驾驶仿真、具身智能等领域对长时程世界模型有迫切需求,记忆效率与一致性直接决定系统可用性;同时,推理显存成本是大规模部署的瓶颈。
行业类比
这类似于 LLM 场景中用 检索增强生成(RAG) 解决长上下文遗忘:不是把所有历史塞进上下文,而是按需检索相关片段注入当前计算,但 HLA-WM 将这一思想迁移到视频世界模型的循环状态空间。
核心洞察
- 将固定大小的线性注意力状态改造为可寻址的层次化记忆:HLA-WM 把 Gated DeltaNet 的递推状态拆解为 chunk-wise transition summaries,再根据相机几何检索相关历史分块并重组成 query-specific 状态。这打破了线性注意力“压缩即遗忘”的固有假设,与 Mamba、RWKV 等仅依靠单一递推状态或全局检索的方法不同,它同时保留局部递推的高效性与全局场景的精确召回,无需训练即可在 60 秒视频生成中降低 28.5% 旋转误差。
- 利用 GDN 的仿射结构实现内存与计算的双重解耦:HLA-WM 缓存紧凑的 chunk 级状态转移摘要而非完整 KV cache,在 60 秒上下文下将历史状态内存降低 12 倍,推理吞吐损失不超过 1.6%。相比 softmax attention 的线性内存增长和普通线性 attention 的固定状态遗忘,该方案在长时程世界模型中首次以可忽略的时延代价获得可检索的记忆能力,为部署轻量级长视频生成器提供了新的工程路径。
方法
输入与总体框架
HLA-WM 面向基于 Gated DeltaNet (GDN) 的长时程视频世界模型推理阶段。输入为当前生成步的 query 特征、历史生成序列的分块缓存、以及每一历史 chunk 对应的相机几何信息(如位姿 / 视角)。方法无需额外训练,直接作用于预训练的自回归生成器。
关键模块一:分块 GDN 记忆
GDN 的状态更新本质是仿射变换,HLA-WM 利用这一性质将长历史划分为多个 chunk,为每个 chunk 缓存一个紧凑的 transition summary(状态转移摘要),替代完整 KV cache 或逐 token 状态。该 summary 保留了 chunk 内状态演化的压缩表示,显著降低历史记忆开销。
关键模块二:几何引导的检索
在生成某步时,方法利用当前相机几何与历史 chunk 的几何标签进行粗粒度检索,筛出与当前场景可能相关的历史 chunk。该检索基于相机姿态 / 位置相似度,避免对所有历史 chunk 做全量计算,同时过滤无关干扰。
关键模块三:选择性状态重组
对检索到的历史 chunk,将其 transition summary 按 query 动态重组为查询特异性递归状态。这一重组过程保持 GDN 的线性注意力效率,但使远距离相关场景的信息能够被重新注入当前状态,缓解原始 GDN 的长程遗忘问题。
输出
输出为改进后的递归状态,用于后续自回归生成,提升长时程场景一致性。实验显示在 SANA-WM-Bench 上带来 0.74 dB PSNR 提升与 28.5% 旋转误差降低,并将历史状态内存降低 12 倍。
与纯 softmax attention 保留全部历史 KV、或纯线性注意力固定压缩状态但易遗忘不同,HLA-WM 提供可寻址的递归记忆,通过几何引导检索与状态重组,在保持 GDN 效率的同时实现选择性长程召回。
实验
实验设计
在 SANA-WM-Bench (60 秒) 与 MBench-A (547 样本、4 子集) 上评估。基线为基础自回归 GDN 生成器,对比 HLA-WM 与全 KV cache;覆盖 revisit 一致性 + 相机控制共 6 项指标,推理时无需额外训练。
关键发现
- HLA-WM 在 6 项聚合指标全部提升:PSNR +0.74 dB,旋转误差 -28.5%。
- 提升在 AR 精修 / 双向精修 后仍保留;在 MBench-A 全子集、全推理模式下 revisit 一致性三项指标均改善。
- 60 秒上下文下,历史状态内存较全 KV cache 降低 12×,推理吞吐最多降 1.6%。
基线对比解读
纯 GDN 远距离场景信息被后续状态更新淹没;全 KV cache 内存随长度线性增长。HLA-WM 缓存 chunk 级过渡摘要,用相机几何检索相关历史 chunk 并重组查询特化状态,形成选择性可寻址记忆。相比 GDN 无训练、即插即用,回补长程一致性;相比全 KV cache,以 ≤1.6% 吞吐代价换 12× 内存压缩。对长时域世界模型工程,几何引导状态重组比堆缓存或更长上下文训练更具性价比。
行业影响
落地场景
HLA-WM 直接适用于需要长时程一致性的视频世界模型,例如自动驾驶仿真、具身智能数据生成、长视频内容创作。在自动驾驶环视仿真中,60 秒场景内车辆经过路口后返回原点,要求车道线、建筑、动态对象状态一致;HLA-WM 通过 geometry-guided retrieval 找回相关历史 chunk,将旋转误差降低 28.5%。另一场景是虚拟主播或动画长视频生成,保持角色外观与背景不漂移,提升连续叙事能力。
商业价值
无需重新训练,作为推理端插件即可提升 PSNR 0.74 dB,并减少历史状态内存 12×。对提供长视频生成 API 的厂商,可直接降低单请求显存成本,尤其长上下文时显存从全 KV cache 的 O(n) 降为近似固定;推理吞吐损失最高仅 1.6%,几乎无感。同时六项一致性指标全面提升,减少人工后期修复,可提高用户留存与付费转化。
与现有产品 / 工作流的接口
可作为 linear attention 推理框架的即插即用模块,位于 recurrent state 更新之后。需要输入相机位姿或几何信息,适合已有 3D-aware 生成或仿真流水线。按 chunk 缓存 transition summary,查询时先检索再重组 state,类似 RAG 但作用于 recurrent memory。可集成到 vLLM、TensorRT-LLM 等推理栈,仅增加轻量检索逻辑,不改变模型权重,适合在 Gated DeltaNet 或 Mamba2 类架构上快速部署。
局限
- **依赖相机几何信息**:HLA-WM 的检索过程以相机几何为依据,需要显式获取相机位姿或运动参数。对于没有相机轨迹或视角未知的视频世界模型(如开放域生成或非导航任务),该方法难以直接应用。论文中的实验集中于导航类基准,未展示在更广泛任务上的适配性,通用性受限。
- **模型专用性较强**:方法利用了 Gated DeltaNet (GDN) 的仿射结构来构建分块转移摘要和状态重组,因此无法迁移到其他循环线性注意力变体(如 Mamba、RWKV)或 Softmax 注意力架构。若要替换底层序列建模层,需要重新设计缓存和重组逻辑,这限制了其作为模块化记忆增强方案的可移植性。
- **实验范围有限**:论文在 SANA-WM-Bench 和 MBench-A 上验证,主要评估重访一致性和相机控制,缺乏对更长时程(如数分钟)、更复杂场景以及多模态指令的测试。尽管推理吞吐量下降仅 1.6%,但未详细分析检索引入的延迟和计算开销,在实际部署中可能成为瓶颈。