SANA-Video 2.0: 混合线性注意力与注意力残差用于高效视频生成
我们推出 SANA-Video 2.0,一个在统一架构下实例化为 5B 和 14B 规模的混合视频扩散 Transformer。它旨在单个 GPU 上生成高达 720p 的高质量视频,在质量上媲美全 softmax 视频 DiT,同时保留了线性注意力对长序列的良好扩展性。 为避免全 quadratic 注意力,Hybrid Linear-Softmax Attention 将门控线性注意力(O(N) 主导的混合)与周期性的门控 softmax 锚点以 3:1 的比例结合,恢复了纯线性注意力缺失的全秩 token 交互。为了在深度上传播这些更新后的表示,Block Attention Residuals (AttnRes) 将完成的 block 摘要路由到后续线性层,实现了锚点特征重用,并将深层有效秩提升约 12%。 通过从头训练,SANA-Video 2.0 直接学习完整的混合模式,而非将预训练模型线性化。降低分辨率代理研究确定 25% softmax 为最佳的效率-质量权衡。40 步采样下,SANA-Video 2.0 在单个 H100 上以 13.2 秒生成 480p 视频,VBench 得分 84.30,与更大规模的 softmax 视频 DiT 竞争,但延迟仅为其一小部分。其编译后的 DiT 前向传播在 720p/60s 下比匹配的全 softmax 基线快 3.2 倍,且差距随视频时长扩大。 此外,全栈 Sol-Engine 优化(内核融合、缓存和稀疏注意力)进一步将该硬件友好型骨干加速 3.58 倍,使 5B 模型在 720p/5s 下达到 13.06 秒,在单个 H100 上比 Wan 2.2-A14B 快 120 倍。总体而言,我们的混合设计以显著降低的成本恢复了 softmax 级别的表现力,解锁了可扩展的长视频和高分辨率视频生成。
论文精读
TL;DR SANA-Video 2.0 通过混合线性与 Softmax 注意力及跨层残差路由,在单 GPU 上实现高效高清视频生成,速度百倍于同类大模型。
问题
问题背景
视频生成领域正追求高分辨率、长时长、强时序一致性的扩散 Transformer(DiT)模型,但推理成本极高,限制单卡部署。
现有方法局限
主流 DiT 依赖全量 softmax 注意力,序列长度增加时计算与显存呈平方增长,生成 720p 长视频需多卡并行,难以在消费级硬件落地。线性注意力虽将复杂度降至 O(N),但缺乏 token 间全秩交互能力,导致生成质量显著下降,尤其在复杂运动与细节保持上出现模糊或闪烁。直接线性化预训练模型会丢失已学到的丰富表达;而从零训练纯线性模型则无法恢复 softmax 层的高阶相关性,深层表征有效秩不足。
为什么这个问题难/重要
挑战在于既要保留线性注意力的长序列可扩展性,又需恢复 softmax 级的 token 交互全秩特性。混合方案需解决:哪些层采用 softmax、如何协调两种注意力、以及如何将锚点特征跨层复用。业界对此高度关注,因为视频生成是通向世界模型与 Physical AI 的关键路径,若能在单卡实现高性价比生成,将推动实时交互式视频应用、机器人与自动驾驶仿真等场景的规模化。
行业类比
类似LLM 推理中混合稀疏-稠密注意力(如 GPT-4 的局部窗口+全局 tokens),在视频生成中以周期 softmax 锚点注入高秩信号,恰好平衡性能与效率。
核心洞察
- **混合线性-softmax注意力** 通过以3:1比例周期性插入softmax锚点,解决了纯线性注意力秩不足的问题,同时保持了O(N)复杂度。与直接线性化预训练模型不同,SANA-Video 2.0从零训练混合架构,代理实验表明25% softmax比例提供最优质量-效率权衡,这一发现为设计高效长序列扩散模型提供了直接指导,避免了全softmax的二次复杂度瓶颈,且无需牺牲生成质量。
- **块注意力残差(AttnRes)** 是一种轻量级跨层路由机制,它将已完成块的注意力总结注入到后续层的线性注意力中,从而复用高质量特征,将深层有效秩提升约12%。这不同于标准Transformer仅依赖残差连接传递信息,而是主动将精炼后的表示向后传播,缓解了深层表示退化。这种设计不限于视频生成,可推广至任何深层Transformer架构以提升高效长序列建模能力。
方法
SANA-Video 2.0 是一种统一架构的视频扩散 Transformer(DiT),支持 5B 和 14B 参数规模,核心目标是在单 GPU 上高效生成高质量视频,同时避免传统 softmax 注意力的平方复杂度。
输入 → 关键模块 → 输出
输入:噪声潜变量(来自 VAE 编码的视频帧)与文本条件(如 T5 编码)。
模型采用流匹配(flow matching)目标,预测速度场或噪声,经 40 步采样去噪得到清晰视频。
关键模块:
- Hybrid Linear-Softmax Attention:混合使用门控线性注意力(GLA) 与门控 softmax 注意力,比例为 3:1(即每 4 个注意力层中,3 层为线性、1 层为 softmax)。线性注意力以 O(N) 复杂度主导 token 混合,而周期性插入的 softmax 锚点(anchor)恢复全秩交互,弥补纯线性注意力秩不足的问题。整个混合结构从零训练,无需线性化预训练模型。
- Block Attention Residuals (AttnRes):在多个 DiT 块之间建立跨层路由。将已完成 softmax 锚点计算的完整块摘要,通过共享路由查询注入到后续线性注意力层,使锚点特征得以复用,提升深层表示的有效秩约 +12%,并稳定训练。
输出:最终去噪潜变量,经 VAE 解码器重建视频,最高 720p 分辨率。
与同类方法的差异
相比直接线性化预训练 DiT 或仅使用稀疏注意力,SANA-Video 2.0 的混合注意力从头训练和跨块注意力残差设计,在维持线性注意力长序列缩放优势的同时,以极低成本恢复 softmax 级表达能力,配合全栈推理优化(Sol-Engine)实现大幅加速。
实验
实验设计
使用5B与14B两档统一架构模型,通过降低分辨率代理实验 (proxy studies) 确定25%的 softmax 锚点比例为质量-效率最优。训练采用从零开始 (from-scratch) 策略,融合内容感知流匹配 (content-aware flow-shift) 和在线强化学习 (online RL) 后训练。设计空间探索覆盖 softmax 比率 (0%–100%) 及注意力残差 (AttnRes) 的有效性。
关键发现
- 5B 模型在单块 H100 上 40 步采样,480p 视频 VBench 得分 84.30,延迟仅 13.2 秒。
- 混合线性-softmax 注意力编译后 DiT 前传比全 softmax 基线快 3.2 倍 (720p/60s 条件下),且差距随视频长度扩大。
- 全栈 Sol-Engine 优化 (kernel 融合、缓存、稀疏注意力) 带来额外 3.58 倍加速,5B 管线生成 720p/5s 视频仅需 13.06 秒,比 Wan 2.2‑A14B 快 120 倍。
- Block Attention Residuals 将深层 token 表示的有效秩提升约 12%,证明跨深度锚点特征复用的有效性。
对比解读
与纯全 softmax 视频 DiT 相比,本工作以显著更低的计算成本恢复了相当的生成质量,核心在于 3:1 的线性/softmax 混合 保持序列线性复杂度同时周期性注入全秩交互。与 Wan 2.2‑A14B 等大模型对比,SANA‑Video 2.0 在单个消费级 GPU 上即可实现高质量长视频生成,凸显线性注意力骨干在工业部署中的实用价值。同时,AttnRes 机制提供了一种轻量级跨层信息路由方案,无需额外参数即能缓解深层表示退化,为后续高效视频模型设计提供了新思路。
行业影响
落地场景
SANA-Video 2.0 的核心突破在于单 GPU 生成 720p 高质量视频,且延迟仅为同类全 softmax 模型的三分之一。这使得实时或准实时的视频生成成为可能,典型落地场景包括:
- 短视频与社交媒体内容生成:平台提供文本/图片转视频工具,降低用户创作门槛。
- 广告创意与电商展示:快速生成商品动态视频,替代昂贵的实拍或 3D 渲染。
- 游戏与影视前期预览:快速生成动作序列、场景概念视频,加速资产迭代。
- 物理 AI 数据合成:利用高效生成能力为自动驾驶、机器人训练构造多样化视频数据。
商业价值
- 降本:推理所需硬件从多卡集群降至单张 H100,硬件成本、运维成本和能耗均大幅下降。5B 模型 720p/5s 生成仅需 13.06s,综合成本仅为 Wan 2.2-A14B 的 1/120 左右。
- 增收:极低延迟和低成本使视频生成服务可以大规模开放给 C 端或 B 端客户,催生新的订阅模式或按用量计费。
- 体验提升:生成速度快、质量高,用户等待时间从分钟级降至秒级,交互式应用(如实时视频编辑预览)成为可能。
与现有产品/工作流的接口
模型提供 Hybrid Linear-Softmax Attention 和 Block Attention Residuals (AttnRes) 两种即插即用模块,可集成到现有 DiT 架构中,无需从头训练。工程上:
- 提供 Sol-Engine 优化栈,包含算子融合、KV 缓存、稀疏注意力,可直接接入 PyTorch 或 TensorRT 推理管线。
- 支持 QAT 低精度推理,可部署于消费级 GPU 或云端 GPU 实例,与现有 API 网关、负载均衡架构无缝衔接。
- 训练框架支持 Direct Preference Optimization (DPO) 和 Online RL,可便捷接入企业自有数据微调,适应垂直行业风格。
具体落地用例
- 电商平台商品短视频生成:商家输入商品图片和描述性文本,模型秒级生成多角度展示视频。相比雇佣模特、租用影棚拍摄,成本降低 90% 以上,且可批量生成 A/B 测试素材,直接提升转化率。
- 影视工作室的前期可视化 (Pre-viz):导演使用文本分镜/草稿图快速生成动画分镜视频,用于团队沟通和投资方展示。SANA-Video 2.0 仅需单 GPU 即可在分钟内输出一段 720p 预览,使小团队也能负担原先需要大型渲染集群的制作流程。
局限
- **Softmax 锚点比例依赖人工设定**:论文通过降分辨率代理实验确定 25% 的 softmax 比例在质量-效率之间取得最优,但该比例可能随视频时长、分辨率及内容复杂度变化,缺乏任务自适应的调整机制,实际部署时可能需要额外调参或动态选择策略。
- **混合注意力的表达上限仍受线性注意力的约束**:尽管周期性插入 softmax 锚点可恢复部分 token 交互,但整体计算仍以线性注意力为主(3:1 比例),在需要精细空间对应或长程因果推理的场景下,其状态秩恢复能力可能弱于全 softmax 注意力,导致在极端生成质量(如 VBench 单项细粒度指标)上略逊于 Wan 2.2 等大模型。
- **训练与部署依赖特定硬件生态**:论文中的效率数据主要基于 H100 GPU 及 Sol-Engine 优化(kernel fusion、caching 等),对非 NVIDIA 硬件或未适配的推理框架的迁移性未验证;另外,14B 模型虽可在单卡运行,但训练仍需大规模算力,且混合架构的算子优化复杂度较高,可能增加工程落地时的适配成本。