论文

CtrlCache: 用控制感知缓存加速交互式视频世界模型

CtrlCache: 用控制感知缓存加速交互式视频世界模型

交互式视频世界模型需在忠实响应用户控制的同时高效生成每个视频块。常见做法是逐块自回归生成加少步去噪,但每块仍需多次昂贵的去噪迭代。免训练缓存可降低成本,却主要依赖模型内部的去噪动态做复用决策,未显式考虑控制切换。事实上,控制信号在块被去噪之前就已到达,可零成本用于调度。 分析显示:动作变化附近相邻块的结构相似度会下降,而低频结构比高频细节更持久。据此提出 CtrlCache,一个免训练的控制感知缓存框架:动作感知的调度与刷新策略检测跨块及块内的动作变化,将每个块标记为 initial、transition、turning、steady 四种状态;在选定的某个内部去噪步,前两类保留完整计算,后两类则复用本块中最近一次完整计算步的 transformer 残差。此外引入频率混合历史先验引导,在无额外 DiT 前向的条件下融入前一个 clean latent 的互补信息。 在 Matrix-Game 2.0 与 LingBot-World v1/v2 上,CtrlCache 无需重新训练模型即取得 1.21x–1.41x 的 DiT 骨干加速,并在三个模型上均将 WBench Overall 分数提升至高于原始推理。

论文精读

TL;DR 利用交互式视频生成中提前到达的控制信号,CtrlCache 通过动作感知缓存和频率混合历史先验,在无需训练的情况下将 DiT 骨干加速 1.21-1.41 倍,同时提升 WBench 得分。

问题

交互式视频世界模型(IVWM)作为具身智能与交互式内容生成的核心组件,正面临实时性与控制保真度的双重挑战。

现有方法主要采用块级自回归与少步去噪(如 4-8 步 DiT),但每个视频块仍需多次完整前向传播,推理开销居高不下。训练无关缓存(training-free caching)方案如 DeepCache、TGATE 通过重用特征减少冗余计算,然而它们仅依赖模型内部去噪动力学(如特征相似度、注意力变化)来制定重用策略,忽略了交互场景中控制信号先于去噪到达这一可利用信息。控制切换会显著改变相邻块的结构相似度,导致这类缓存策略在动作变化时错误重用,损害生成质量与控制响应。

该问题的难点在于:控制信号与视频内容的时序耦合要求缓存决策同时优化计算效率与控制保真度;动作变化前后视觉结构差异大,而稳态时高频细节变化快但低频结构持久,静态缓存策略难以动态适应。此外,在不重训模型的前提下实现自适应计算,需要轻量的控制感知调度,这对实时交互应用(如游戏世界模型、具身仿真)至关重要,业界普遍关注低延迟、高吞吐的推理优化。

类似自动驾驶仿真中根据规划轨迹动态调整传感器融合与渲染精度,交互式视频世界模型也需要依据控制序列动态分配去噪计算,在保持响应性的同时降低推理成本。

核心洞察

  • 第一条:`CtrlCache` 的核心洞察是,交互式视频世界模型的控制输入在去噪前已知,可作为零成本的缓存调度信号。 现有训练无关缓存策略依赖模型内部状态(如残差相似度)决定是否重用,忽略了控制转移这一显式信号。**CtrlCache** 通过分析相邻 chunk 的控制变化,将动作变化映射为计算状态,从而在动作稳定时安全重用,在动作变化时保持全精度。这种将外部控制信号纳入调度的方法,不仅降低了缓存决策的延迟和开销,还更适应交互场景中控制序列动态变化的特性,比基于模型内部状态的启发式方法更直接有效。
  • 第二条:`CtrlCache` 观察到视频生成中低频结构(如场景布局、运动趋势)比高频细节在控制序列稳定时更持久,因此提出频率混合的历史先验引导,无需额外 `DiT` 前向传播。 在稳态交互(如持续前进)中,相邻 chunk 之间的结构相似性高,但高频纹理可能变化,而低频布局基本不变。**CtrlCache** 利用上一 chunk 的干净潜在变量提取低频信息,在去噪过程中作为先验引导,避免完全重用导致细节退化,同时不增加计算负担。这与传统缓存只重用计算结果的思路不同,它通过注入历史低频信息提升生成质量,并在基准测试中同时实现了加速和 **WBench** 分数提升,验证了这种频率分离策略的有效性。

方法

方法详解

输入:交互式视频世界模型以 chunk 为单位接收用户控制序列,采用 chunk-wise 自回归生成,每个 chunk 需多步 denoising。控制序列在 chunk 生成前已到达,可零成本用于调度。

关键模块

  1. 动作感知调度与刷新策略:分析相邻 chunk 及 chunk 内部的动作变化,将每个 chunk 标记为 initial(初始)、transition(过渡)、turning(转弯)或 steady(稳态)。在选定的内部去噪步骤中,initial 和 transition chunk 保留完整计算;turning 和 steady chunk 则复用同一 chunk 内最近一次完全计算的 Transformer 残差,跳过该步骤的 DiT 前向。

  2. 频率混合历史先验引导:观察到稳态交互时低频结构比高频细节更持久,CtrlCache 将前一干净 latent 的低频成分作为历史先验,与当前部分计算结果融合,在无额外 DiT 前向的条件下补充背景一致性信息。

输出:在每个 chunk 的生成过程中,根据控制状态自适应跳过部分 denoising 步骤,得到与原始推理一致的视频潜变量,实现 DiT 骨干加速。

与同类训练免费缓存方法的差异:现有方法主要依据模型内部 denoising 动态决定复用,而 CtrlCache 显式利用提前已知的控制序列进行状态划分与调度,并引入频率分离的历史先验,在不增加前向成本的前提下保留低频结构。

实验

实验设计

  • 在两个交互视频世界模型基准上评估:Matrix-Game 2.0、LingBot-World v1/v2,覆盖不同控制模式。
  • 对比基线为各自模型的原始推理(无缓存),报告 DiT 骨干加速比 和 WBench Overall 分数。
  • 方法为训练无关,无需重训或额外标注,仅在推理时应用控制感知缓存策略。

关键发现

  • 加速比达 1.21x - 1.41x,且所有三个模型上 WBench Overall 分数均优于原始推理。
  • 表明通过控制感知的缓存调度与历史先验引导,不仅能减少去噪迭代成本,还改善了生成质量或时序一致性(可能由于低频结构复用提升了稳定性)。

与基线对比

  • 与只依赖模型内部去噪动态的缓存策略不同,CtrlCache 显式利用控制信号(动作变化)进行调度,且调度本身零额外前向成本。
  • 该设计面向交互式视频生成场景,将控制序列作为免费先验,有效区分 initial、transition、turning、steady 状态,实现更精细的逐样本资源分配。

行业影响

落地场景

  • 交互式视频世界与云游戏:面向用户控制的虚拟环境生成,如互动影视、开放世界游戏、虚拟直播,每段视频 chunk 需在几百毫秒内响应控制信号,CtrlCache 可减少 DiT 去噪计算量。
  • 电商交互展示:在 AR 试穿、家具摆放、商品 3D 操作等场景中,用户拖拽/旋转/切换视角会连续触发视频生成,该缓存框架可在不重训模型的前提下降低单次生成时延。
  • 自动驾驶与机器人仿真:闭环仿真中策略或人类操作员控制视角与场景,低延迟视频合成有助于提高仿真吞吐与拟真度。

商业价值

  • 降本:作为训练无关方法,CtrlCache 在 DiT 骨干上实现 1.21x 至 1.41x 加速,直接减少每次交互的 GPU 占用与推理成本,同等硬件可支撑更高并发用户数。
  • 体验提升:论文实验显示 WBench Overall 不下降,生成质量与控制一致性保持,有望减少交互等待感,提升用户留存和转化率;对已部署的 DiT 模型无需重新训练,降低升级风险。
  • 部署灵活性:不依赖特定模型结构,适用于任何采用 chunk-wise 自回归与少步去噪的交互视频生成系统。

与现有工作流接口

  • 作为采样器级缓存策略插入现有 DiT 去噪循环:利用 chunk 的控制序列调度计算,不需要修改模型权重或训练数据。
  • 可与 TensorRT / vLLM 等推理引擎集成,将 control_sequence 作为额外输入,替换原有 cache 决策逻辑,通过 chunk 状态机(initial/transition/turning/steady)动态分配计算。
  • 频率混合历史先验可直接对接已有的历史 latent 缓存机制,运行时以低成本方式融合前一 chunk 的干净 latent,无需额外 DiT 前向。适合作为即插即用加速模块,纳入交互视频产品的推理优化栈。

局限

  • 依赖控制信号质量与可预测性:CtrlCache 的核心假设是控制序列在去噪前已知且可解析为离散状态(初始、过渡、转向、稳态)。但在真实交互系统中,控制可能包含噪声、延迟或连续变量,状态标记容易出错,导致重用策略失效。此外,若动作频繁切换,绝大多数块被标记为过渡或转向,稳态缓存机会减少,加速比可能显著低于报告值。该方法对控制行为的先验假设较强,限制了其在复杂或非确定性控制场景的普适性。
  • 实验泛化性与兼容性有限:论文仅在 Matrix-Game 2.0 和 LingBot-World v1/v2 上评估,这三个环境均属游戏导航类,动作空间离散且场景变化模式相对可预测。对于连续控制、高动态真实场景或不同 DiT 变体,论文观察到的低频结构持久性是否成立仍有待验证。同时,与 Delta DiT、ToCa 等通用训练 free 缓存相比,CtrlCache 需要访问控制信号并额外维护状态机,实现复杂度更高,且加速比(1.21-1.41x)并未拉开显著差距,实用价值需权衡。
论文Shangye Song2026-10-06原文

相关内容