行业新闻

哈工大深圳与 NUS 提出 QuantWM,2-bit KV Cache 量化改善视频世界模型画质

视频世界模型把 KV Cache 压到 2-bit 会掉画质,而评测指标看不出来;原因在 Key 量化扰乱了注意力对历史帧的选择,QuantWM 用免训练补偿修好了它。

视频世界模型(能按用户动作持续生成连续画面的模型)用 KV Cache 缓存历史画面,显存开销很大。已有方法把 KV Cache 压到 2-bit,评测分数看着不错,但画面会闪烁、模糊。哈工大(深圳)iLearn-Lab 与新加坡国立大学 LV-Lab 发现,问题出在 Key 量化后注意力选错了历史帧,于是提出免训练的 QuantWM,保护模型的检索方式,最高压缩 6.20 倍。

正文摘录

![图片](https://image.jiqizhixin.com/uploads/article/coverimage/2804455b-311d-401b-937c-b8dadcf341f3/014(2).jpg) ![图片](https://mmbiz.qpic.cn/szmmbizpng/5L8bhP5dIqElqZ0GcgINP4V78xIEARSSDI7pRpUQpZAhGK6rr8zoMJM3icYLohdHNhq93gll1YkHwsYaOO3tolCuL5QN5gAtJc46PnNgECQI/640?wxfmt=png&from=appmsgimgIndex=0) 视频世界模型(Video World Model)需要生成连续画面,并在用户指定动作的控制下维持场景一致性。对于基于自回归生成的视频世界模型,KV Cache 中保存着历史画面,使得生成时能够检索并重复利用此前生成的相似场景。然而随着生成的不断进行,KV Cache 的显存成本十分高昂。例如 LingBot-World-v2 生成约 5 秒、93 帧的视频,KV Cache 就需要超过 21 GiB 显存。 将 KV Cache 量化到 2-bit 是缓解这一问题的重要方向,目前已有方法将 2-bit KV Cache 量化应用于自回归视频生成,并取得接近 BF16 的 VBench 评测表现。但研究团队发现,当将这些方法应用于视频世界模型时,即使评测分数几乎不变,生成画面仍可能出现明显的闪烁、模糊和细节失真。 哈尔滨工业大学(深圳)iLearn-Lab 与新加坡国立大学 LV-Lab 的研究团队 深入分析了这一现象,并 提出面向视频世界模型的免训练 2-bit KV Cache 量化框架 QuantWM 。

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-10-07原文

相关内容