开源项目

Sana

Sana

基于线性 Diffusion Transformer 的高效图像/视频生成框架,支持从 512px 到 4K 分辨率的 T2I 和 T2V。核心亮点是采用 Linear Attention + DC-AE 32× 压缩大幅降低计算量,在 1024×1024 生成上比 FLUX 快 20 倍以上,且模型仅 1.6B 参数。已发布 SANA-1.5(训练/推理缩放)、SANA-Sprint(一步生成)、SANA-Video(长视频)等系列,支持 ComfyUI、Diffusers、SGLang 部署。研究向,开源 Apache 2.0。

README

logo

📚 文档 | SANA | SANA-1.5 | SANA-Sprint | SANA-Video | SANA-WM | Sol-RL

Demo | 🤗 HuggingFace | ComfyUI | SGLang | Cosmos-RL

         

   

ICLR 2025 Oral | ICML 2025 | ICCV 2025 Highlight | ICLR 2026 Oral

SANA 是一个以效率为核心的高分辨率图像和视频生成代码库,提供完整的训练和推理流程。本仓库包含 SANA、SANA-1.5、SANA-Sprint、SANA-Video、SANA-WM 和 Sol-RL 的代码。更多细节请查看我们的 📚 文档。

加入我们的 Discord 社区参与讨论!如有任何问题、遇到 Bug 或想贡献代码,欢迎随时联系我们!

teaser_page1

新闻

  • 🔥 [2026/05] 🌍 SANA-WM: 2.6B 可控世界模型 发布!支持 720p、1 分钟视频生成,6自由度相机控制。世界模型和具身AI的新基线。参见 项目页 | 论文.
  • 🔥 [2026/04] ⚡ Sol-RL: NVFP4 展开、BF16 训练 RL 可用!包括 SANA、FLUX.1 和 SD3.5-L 的所有训练配方,以及捆绑的后训练数据集。参见 Sol-RL 文档 | 页面 | 论文.
  • 🔥 [2026/03] 📺 SANA-Video 720p 模型(含 LTX-VAE) 发布。配合 LTX2 Refiner 可将视频上采样至 2K 分辨率!参见 模型动物园、SANA-Video 文档 和 关于 Refiner 的博客.
  • 🔥 [2026/03] 💪 后训练基础设施:SANA × Cosmos-RL — 我们与 Cosmos-RL 合作,为 SANA 提供完整的 RL 基础设施。您现在可以使用最先进的算法(如 Diffusion-NFT、Flow-GRPO)、预设配置、奖励服务和灵活的数据集对 SANA-Image 和 SANA-Video 进行后训练(SFT/RL)。参见 Cosmos-RL 上的 SANA 和我们的 Cosmos-RL 集成文档.
  • 🔥 [2026/02] 🚀 SANA 现已支持 SGLang! 高性能服务,兼容 OpenAI API。[使用指南]
  • 🔥 [2026/01/26] SANA-Video 被 ICLR-2026 接收为 Oral。 🎉🎉🎉
  • 🔥 [2025/12/09] 🎬 LongSANA: 27FPS 实时分钟级视频生成模型,训练和推理代码均已发布。感谢 LongLive Team。参考:[Train] | [Test] | [Weight]
  • 🔥 [2025/11/24] 🪶 博客: Causal Linear Attention 如何为 LLM 和长视频生成解锁无限上下文。
  • 🔥 [2025/11/9] 🎬 介绍视频 展示了 Block Causal Linear Attention 和 Causal Mix-FFN 的工作原理。
  • 🔥 [2025/11/6] 📺SANA-Video 已合入 diffusers。如何使用.
  • 🔥 [2025/10/27] 📺SANA-Video 发布。[README] | [权重] 支持文本到视频、文本图像到视频。
  • 🔥 [2025/10/13] 📺SANA-Video 即将发布,1). 5秒 Linear DiT 视频模型,2). 实时分钟级视频生成(配合 LongLive)。[论文] | [页面]
点击展开所有更新

💡 简介

我们推出 SANA,一系列高效扩散模型,用于高分辨率图像和视频生成:

  • SANA:最高 4K 分辨率的文本到图像生成,体积比 Flux-12B 小 20 倍,速度快 100 倍。
  • SANA-1.5:高效的训练时间和推理时间计算缩放,以获得更高质量。
  • SANA-Sprint:通过 sCM 蒸馏实现单步/少步生成,H100 上 0.1 秒生成 1024px 图像。
  • SANA-Video/LongSANA:高效的视频生成,采用 Block Linear Attention / LongLive。
  • Sol-RL:NVFP4 展开、BF16 训练 RL,实现 4.64× 更快收敛。
  • SANA-WM:2.6B 参数可控世界模型,生成 720p、1 分钟视频世界,支持 6-DoF 相机控制。

关键技术:

  • Linear Attention:用线性注意力替换 DiT 中的标准注意力,在高分辨率下提高效率。
  • DC-AE:32× 图像压缩(相比传统 8×),减少 latent 令牌数。
  • Decoder-only Text Encoder:现代 decoder-only LLM,结合 in-context learning,实现更好的文本-图像对齐。
  • Block Causal Linear Attention & Causal Mix-FFN:高效的注意力和前馈网络,用于长视频生成。
  • Flow-DPM-Solver:通过高效的训练和采样减少采样步数。
  • sCM Distillation:通过连续时间一致性蒸馏实现单步/少步生成。
  • Sol-RL:低精度(NVFP4)展开选择,高精度(BF16)优化,加速 RL 训练。
  • 可控世界建模:高效长上下文建模和相机轨迹控制,实现一致的 world generation。

总结,SANA 是一个完全开源的框架,集成了高效的训练、快速推理和灵活部署,适用于图像和视频生成。通过 4-bit 量化,可在显存 < 8GB 的笔记本 GPU 上部署。

teaser_page2

快速开始

git clone https://github.com/NVlabs/Sana.git
cd Sana && ./environment_setup.sh sana

使用 🧨 diffusers 推理

import torch
from diffusers import SanaPipeline

pipe = SanaPipeline.from_pretrained(
    "Efficient-Large-Model/SANA1.5_1.6B_1024px_diffusers",
    torch_dtype=torch.bfloat16,
)
pipe.to("cuda")

pipe.vae.to(torch.bfloat16)
pipe.text_encoder.to(torch.bfloat16)

prompt = 'a cyberpunk cat with a neon sign that says "Sana"'
image = pipe(
    prompt=prompt,
    height=1024,
    width=1024,
    guidance_scale=4.5,
    num_inference_steps=20,
    generator=torch.Generator(device="cuda").manual_seed(42),
)[0]

image[0].save("sana.png")

[!TIP] 升级您的 diffusers>=0.32.0 以使用 SanaPipeline。更多细节见 📚 文档.

入门指南

性能

图像生成(1024px)

方法 (1024x1024) 吞吐量 (samples/s) 延迟 (s) 参数量 (B) 加速比 FID ↓ CLIP ↑ GenEval ↑ DPG ↑
FLUX-dev 0.04 23.0 12.0 1.0× 10.15 27.47 0.67 84.0
Sana-0.6B 1.7 0.9 0.6 39.5× 5.81 28.36 0.64 83.6
Sana-0.6B 1.7 0.9 0.6 39.5× 5.61 28.80 0.68 84.2
Sana-1.6B 1.0 1.2 1.6 23.3× 5.92 28.94 0.69 84.5
Sana-1.5 1.6B 1.0 1.2 1.6 23.3× 5.70 29.12 0.82 84.5
Sana-1.5 4.8B 0.26 4.2 4.8 6.5× 5.99 29.23 0.81 84.7

视频生成(VBench 720p)

模型 延迟 (s) 参数量 (B) VBench 总分 ↑ 质量分 ↑ 语义分 ↑
Wan-2.1-14B 1897 14 83.73 85.77 75.58
Wan-2.1-1.3B 400 1.3 83.38 85.67 74.22
SANA-Video-2B 36 2 84.05 84.63 81.73

💪待办列表

我们将尽力实现以下目标

  • [✅] 训练代码
  • [✅] 推理代码
  • [✅] 模型动物园
  • [✅] ComfyUI 节点(SANA, SANA-1.5, SANA-Sprint)
  • [✅] DC-AE Diffusers
  • [✅] Sana 合入 Diffusers (https://github.com/huggingface/diffusers/pull/9982)
  • [✅] LoRA 训练 @paul (diffusers: https://github.com/ huggingface/diffusers/pull/10234)
  • [✅] 2K/4K 分辨率模型。(感谢 @SUPIR 提供 4K 超分辨率模型)
  • [✅] 8bit / 4bit 笔记本开发
  • [✅] ControlNet(训练 & 推理 & 模型)
  • [✅] FSDP 训练
  • [✅] SANA-1.5(更大模型尺寸 / 推理缩放)
  • [✅] SANA-Sprint:少步生成器
  • [✅] 更快的 DCAE-Lite 权重
  • [✅] 更好的重建 F32/F64 VAEs
  • [✅] SANA-Video:Linear DiT 视频模型,以及实时分钟级
开源项目NVlabs2026-05-18原文

相关内容