北大清华阿里提出 SparkDiffusion:视频生成提速 265 倍
视频生成加速一直靠零散优化单点组件,这篇论文指出极稀疏下逐步训练会失效,并用终端对齐的监督方式把稀疏、蒸馏、量化统一起来。
视频扩散模型生成一段 5 秒 720P 画面通常要花一小时以上。北大、清华、阿里巴巴等团队发现:把注意力稀疏度推到 97% 时,训练损失还在降,画面却崩坏——他们称之为「高稀疏陷阱」,问题出在高噪声阶段的误差被后续步骤放大。SparkDiffusion 把稀疏注意力、少步蒸馏和 FP8 量化整合进一个框架,在单卡 RTX 5090 上实现 265 倍加速。
正文摘录
.jpg)  随着 Sora、Runway 等视频生成模型的快速迭代,AI 视频生成正在变得越来越普及。但生成速度慢、算力门槛高的问题,让大多数开发者和创作者难以将其落地。一段 5 秒 720P 视频,传统方法需要超过 1 小时才能完成扩散生成——这给实时创作、批量生成与消费级硬件部署带来了巨大挑战。 更令人困惑的是,当研究者试图通过极致稀疏化(97% 稀疏率)来突破性能瓶颈时,却发现了一个 反常现象 :训练损失持续下降,生成视频质量却急剧恶化——人物破碎、背景扭曲、时序混乱。 针对这一问题,北京大学、清华大学、阿里巴巴等机构的研究者提出了 SparkDiffusion:首个将稀疏注意力、少步蒸馏与低精度量化整合到统一框架(含开源权重及完整训练代码)的视频生成加速系统 ,推动 DiT 视频生成从「分散优化单个组件」转向「端到端系统化加速」的新范式。