LightX2V 推 LightWan2.2-A14B:单卡运行 14B 视频模型,720p 生成提速至秒级
LightX2V 通过蒸馏、量化和稀疏注意力,让 14B 视频模型在单卡实时生成 720p 视频,速度提升数百倍。
LightX2V 团队针对 Wan2.2-A14B(一个 140 亿参数的视频生成模型)推出优化版本 LightWan2.2-A14B,通过步数蒸馏(把生成所需的去噪步骤从 40 步压缩到 4 步)、NVFP4 量化感知训练(让模型在训练时就适应低精度计算)和动态稀疏注意力(只计算视频序列中最重要的部分)等方法,将计算量大幅压缩。在 8 张 RTX 5090 显卡上生成一段 5 秒 720p 视频,文生视频仅需 3.8 秒,图生视频仅需 4.5 秒,相比原模型加速最高达 705.8 倍;单卡也能运行,最快提速 118.7 倍。
正文摘录
 新智元报道  生成一段 5 秒 720p 分辨率视频,为什么要等数十分钟? 对 14B 级视频生成模型来说,高分辨率、长时序和强运动一致性提升了画质,也同步拉长 Token 序列,放大注意力计算和显存峰值。消费级 GPU 必须同时面对速度与显存两道门槛。 LightX2V 团队面向 Wan2.2-A14B 推出 LightWan2.2-A14B ,以步数蒸馏、NVFP4 量化感知训练和动态稀疏注意力压缩计算量,再用高效算子、细粒度卸载和多卡通信优化打通整条推理链路。 最终,14B 模型可以在单张 RTX 5090 上高效运行。 8 卡生成 5 秒 720p 视频时, T2V(文生视频)仅需 3.8 秒、I2V(图生视频)仅需 4.5 秒 。相较原始 40 步模型,最高加速分别达到 705.8 倍和 599.3 倍。 5 秒视频,最快 3.8 秒生成。T2V 与 I2V 双双实现 720p 实时生成。