浙大联合NVIDIA提出Light Interaction,视频世界模型推理提速2.59倍
Light Interaction利用交互状态动态调度计算,无需重训即可显著加速视频世界模型的长轨迹推理。
交互式视频世界模型在长时间生成时会面临高计算和显存开销。浙江大学与NVIDIA提出Light Interaction,它不修改模型参数,只在推理阶段根据相机轨迹动态选择历史上下文、复用去噪结果,并通过3D稀疏注意力降低计算,在HY-WorldPlay上实现2.59倍加速,显存降低28%。
正文摘录
 新智元报道  【新智元导读】 交互式视频世界模型正在从「一次性生成短片」走向「像游戏一样边操作边生成」。但长轨迹交互会迅速放大上下文、显存和多步去噪开销。Light Interaction 不改模型参数、不重新训练,只在推理阶段把相机轨迹变成调度信号,动态选择历史上下文、在回访状态复用去噪输出,并用面向自回归生成的 3D 稀疏注意力降低计算。 视频世界模型想真正进入交互时代,不能只停留在一次性生成几秒视频。它需要像游戏引擎一样,根据用户前进、后退、转向、回看等操作,持续生成后续画面,并让场景在长时间探索中保持一致。 问题在于,生成链路越长,成本越难压。 以 HY-WorldPlay 为例,单张 A100 GPU 上生成约 10 秒视频,模型主干推理耗时超过 200 秒。为了保持长时一致性,模型需要维护较重的历史信息;当前片段需要参考更长上下文;每生成一个视频片段,又要经过多步去噪。 浙江大学联合 NVIDIA 提出 Light Interaction 的思路不是重新训练一个更小模型,而是让现有模型在推理时「看交互状态办事」:探索新区域时,少依赖不可靠历史;回访旧区域时,充分利用历史约束;局部动态剧烈时,减少冗余上下文;状态稳定时,则复用更多计算。