论文

WorldKV: 高效的世界记忆与 World Retrieval 和 World Compression

WorldKV: 高效的世界记忆与 World Retrieval 和 World Compression

自回归视频扩散模型已实现实时的、基于动作的世界生成,但维持持久世界(即重新访问之前视角时内容一致)仍是开放问题。全 KV 缓存注意力可保持一致性,但破坏实时性:内存占用和注意力成本随展开长度线性增长。滑动窗口推理恢复吞吐量,但丢弃长期一致性。 本文提出 WorldKV,一种无需训练框架,包含两个组件:World Retrieval 和 World Compression。World Retrieval 将驱逐的 KV 缓存块存储在 GPU/CPU 内存中,并通过相机/动作对应关系选择性地检索场景相关块,将其插回原生注意力窗口而无需重新编码。World Compression 通过基于锚帧的键-键相似性修剪每个块中的冗余标记,将每块存储减半,在固定预算下容纳两倍历史。 在 Matrix-Game-2.0 和 LingBot-World-Fast 上,WorldKV 匹配或超越全 KV 内存保真度,吞吐量约为两倍,且无需微调即可与经过记忆训练的基线竞争。

论文精读

TL;DR WorldKV 通过检索与压缩被驱逐的 KV 缓存,在不重新训练的前提下,使视频扩散模型以约 2 倍吞吐量实现持久场景一致性,性能媲美全注意力。

问题

问题背景

自回归视频扩散模型通过因果注意力与 KV-cache 实现实时动作/相机条件的世界生成,但维持可重访的持久世界记忆 仍是一个核心挑战。在游戏、具身智能、机器人仿真中,智能体在场景中移动并返回时,要求视觉内容严格一致。

现有方法的局限

  • 全 KV-cache 注意力:保留所有历史帧的键值对,重访时能完美重现画面,但内存与计算成本随交互长度线性增长,破坏实时推理的延迟约束,无法实际部署。
  • 滑动窗口推理:仅缓存最近几帧的 KV,保持固定吞吐,却丢弃了窗口外的长期语境,导致回到之前视角时生成不一致内容。
  • 部分方法引入可学习的记忆模块,但需要额外微调,对模型结构与训练数据有强依赖,难以即插即用。

为何该问题重要且困难

实时互动世界生成需要毫秒级延迟,而记忆的忠实度又要求尽可能多的历史信息,两者存在根本性矛盾。实验发现,在相机或动作重访时,注意力呈现高度稀疏性——极少数历史 token 对当前帧有贡献,这为选择性检索提供了可能;但如何高效定位且不引入重编码开销地复用这些 token,是技术上的一大难点。此外,缓存分块存入 GPU/CPU 内存后,需在固定容量下最大化有效历史长度,这对压缩策略提出了苛刻要求,且必须保证恢复出的 KV 能无缝融入原生注意力窗口。业界对无需微调 的通用方案需求强烈,因为重新训练大规模世界模型成本高昂且需适配不同基座。

行业类比

类比于大语言模型通过检索增强生成(RAG)扩展长上下文窗口,WorldKV 为视频世界模型提供了类似的记忆外挂,实现高效的历史帧复用。

核心洞察

  • WorldKV 提出训练无关的 KV 缓存管理策略,在自回归视频扩散模型中实现持久世界记忆,无需任何微调即可在一致性与吞吐量之间取得平衡。与完全依赖滑动窗口(牺牲长期一致性)或全 KV 缓存(线性增长的内存与计算开销)的方案不同,WorldKV 通过选择性检索与压缩,在固定预算下将历史容纳量翻倍,同时维持约 2 倍于全注意力的吞吐量。这种即插即用的设计大幅降低了部署实时交互世界模型的工程门槛。
  • 世界检索利用相机 / 动作对应关系作为结构化线索,从已逐出的 KV 缓存块中精准召回场景相关上下文,而非依赖通用的 token 相似度检索。这一显式条件匹配直接对应空间导航中的视角重现需求,避免了隐式相似度可能引入的无关信息,且检索到的块无需重编码即可插回原生注意力窗口,显著减少计算浪费。该机制为具身 AI 与游戏模拟中的长期一致性提供了更可解释、更鲁棒的记忆基础。

方法

输入与问题

自回归视频扩散模型在实时生成时,每个时间步都会产生大量的 KV 缓存,用于因果注意力机制。随着 rollout 长度增加,完全 KV 缓存会维持所有历史 token 的键值对,导致内存和计算开销线性增长,破坏实时性。而滑动窗口推理仅保留近期 token,虽恢复吞吐却丢失长期一致性。

方法概述

WorldKV 是一种训练无关的框架,通过在 GPU/CPU 内存中管理被滑动窗口驱逐的 KV 缓存块,实现持久世界记忆。它包含两个协同模块:

1. World Retrieval(世界检索)
  • 存储阶段:将超出注意力窗口的 KV 缓存按块(chunk)顺序存入离线内存,无需重新编码。
  • 检索阶段:当相机/动作条件与历史片段相似时,利用相机/动作对应(camera/action correspondence)快速定位场景相关块。
  • 融合机制:将检索出的 KV 块直接插入当前的原生注意力窗口,不经过额外特征提取,从而恢复丢失的长程上下文。
2. World Compression(世界压缩)
  • 冗余度量:通过计算块内 token 与锚定帧(anchor frame)的键-键相似度(key-key similarity),评估每个 token 的信息冗余程度。
  • Token 剪枝:基于相似度分数,剪除冗余 token,将每块存储量减半,从而在固定总预算下容纳 2 倍的历史跨度。

输出效果

WorldKV 使扩散模型在不重新微调的情况下,以约 2 倍吞吐量实时生成长期一致的视频世界,在 Matrix-Game-2.0LingBot-World-Fast 基准上,记忆保真度匹配或超越完全 KV 缓存,并与需要额外训练的记忆训练基线性能相当。

与同类方法的差异

不同于现有方法需要修改模型结构或添加记忆模块并微调,WorldKV 是首个真正训练无关、即插即用的 KV 缓存管理策略,通过检索与压缩双管齐下,在不牺牲推理速度的条件下恢复长程一致性。

实验

实验设计

在两个交互式世界生成基准上评估 WorldKVMatrix-Game-2.0LingBot-World-Fast,使用自回归视频扩散模型作为基础模型。对比基线包括 全 KV-cache 注意力(保真度上限,但吞吐低)、滑动窗口推理(吞吐高,但牺牲长期一致性)以及需要额外训练的 记忆增强基线。实验同时覆盖定量指标(记忆保真度、吞吐量)和定性可视化,并通过消融研究分别考察块内压缩比、块间压缩比、检索算法选择与检索块大小的影响。

关键发现

  • 记忆保真度:WorldKV 在两个基准上均达到或超越全 KV-cache 的水平,成功保持相机或动作回访时的场景一致性,而滑动窗口方法则出现明显的内容漂移。
  • 效率提升:吞吐量达到全 KV 的约 2 倍,主要得益于稀疏的 World Retrieval 仅注入相关历史块,以及 World Compression 将每块存储量减半,在固定内存预算下容纳两倍的历史信息。
  • 无需微调:作为 training-free 框架,WorldKV 可直接适配现成模型,与需要专门训练的记忆基线表现相当,大幅降低部署门槛。

与基线对比的深度解读

全 KV-cache 随着 rollout 长度线性增长的内存与计算使其无法实时运行;滑动窗口虽保持实时性,但每步丢弃旧键值导致世界状态断裂。WorldKV 通过 选择性检索 + 压缩 取得权衡:仅引入场景相关块,且压缩去除块内冗余,从而在几乎不影响保真度的前提下将吞吐提升至滑动窗口水平。与记忆增强基线(如通过额外记忆模块训练)相比,WorldKV 无需任何微调即可达到竞争性能,这对快速迁移到不同模型架构或领域具有重要工程意义——意味着从业者可以零代码修改基座模型权重,仅在外围附加检索缓存与压缩逻辑,即可获得持久世界生成能力。

行业影响

落地场景

WorldKV 的核心价值在于让自回归视频扩散模型在维持世界一致性的同时保持实时吞吐,直接受益的场景包括:

  • 交互式游戏与虚拟环境:玩家自由移动视角时,重访地点看到的画面需一致;WorldKV 允许以接近滑动窗口的吞吐量得到全 KV 缓存的质量,大幅减轻 GPU 显存压力。
  • 具身 AI 与机器人仿真:长时间推演中,环境记忆必须持续存在;WorldKV 可让仿真器以极高帧率运行,同时准确回忆先前状态。
  • 数字孪生与实时可视化:工业监测、建筑漫游等应用中,用户频繁切换视角,WorldKV 可保证视觉连贯性且不降低响应速度。

商业价值

  • 降本:传统全 KV 缓存注意力使显存和计算量随序列长度线性增长,无法在消费级 GPU 上长期推演。WorldKV 通过检索与压缩将 KV 缓存占用减半,同样硬件预算下可维护 2 倍 的历史,显著降低部署成本。
  • 增收与体验提升:在电商虚拟展厅、房地产线上看房等场景中,一致的视觉记忆让用户自由环顾而不产生割裂感,提升停留时长与转化可能。对于云游戏/互动流媒体,吞吐量翻倍意味着成本相同下可服务更多并发用户。
  • 无训练即插即用:WorldKV 完全训练无关,不对原模型权重做任何修改,既保护了已有投资,又能在新模型上快速启用,极大缩短落地周期。

与现有产品/工作流的接口

WorldKV 可作为注意力模块的轻量级中间件集成到现有自回归视频扩散推理栈中:

  1. 在模型的注意力层注入 World Retrieval 逻辑,对超出注意力窗口的 KV 块进行片外存储(GPU/CPU 内存)。
  2. 根据相机/动作对应关系检索相关历史块,透明地插入当前注意力窗口,无需重新编码。
  3. 通过 World Compression 对每块基于 key-key 相似度剪枝冗余 token,保证压缩率的同时不破坏关键视觉信息。

整个模块以 hook 形式接入 PyTorch 等框架,不影响原有训练流程,适合作为插件部署到现有的世界模型推理服务中。

具体落地 Use Case

  • 云原生虚拟世界平台:一家提供虚拟活动(会议、展览)服务的公司,使用自回归视频扩散模型实时渲染 3D 空间,参与者可在场景中走动。WorldKV 让服务器在保持高吞吐下提供无缝的环境记忆,当用户绕回起点时看到的展台与开始时一致,避免重新生成带来的算力浪费。
  • 电商 3D 商品展示:消费者在其中旋转产品、切换视角查看细节,模型若遗忘先前帧会出现纹理闪烁或结构突变。WorldKV 能以低显存代价维持跨视角一致性,提升产品浏览的沉浸感,对高客单价的耐用品(如家具、汽车)尤其有利。

局限

  • **检索依赖明确相机/动作对应**:World Retrieval 的召回依赖于相机位姿或动作信息的可匹配性,当场景中动作不精确、观测部分缺失或交互方式为自由文本时,启发式对应可能失效,导致历史 KV 块未被正确检索,损害世界一致性。此限制在具身智能或开放域交互中尤为明显。
  • **压缩可能丢弃关键细节**:World Compression 基于键-键相似度进行 token 剪枝,使用单一锚帧判别冗余,可能过度删除视觉上不明显但对连贯性重要的 token(如细小物体、边缘或运动边界),且压缩比超参数需针对场景微调,缺乏自适应机制,长期记忆的精细度下降。
  • **评估场景覆盖不足**:实验仅在 Matrix-Game-2.0 和 LingBot-World-Fast 两个合成游戏基准上进行,缺少真实世界动态场景、高分辨率或超长周期(>万步)的验证,泛化到野外视频生成器或物理仿真器的能力未知;此外,未与基于学习的紧凑记忆模块(如 RMT、MAMBA)在同等资源下深度对比,仅与全 KV 缓存和滑动窗口比较。
论文Jung Yi2026-05-21原文

相关内容