LTX-2
基于DiT架构的首个音频-视频生成基础模型,能够同步生成对齐的音频和视频内容。亮点在于将音频与视频生成整合到单一22B参数模型中,支持多种生成模式(文生视频、图生视频、音频生视频等),并提供了生产级的两阶段管道和LoRA微调工具,开源权重且可商用。
README
LTX-2
LTX-2 是首个基于 DiT(扩散 Transformer)的音视频基础模型,在一个模型中集成了现代视频生成的全部核心能力:同步音频与视频、高保真度、多种性能模式、可投入生产的输出、API 访问以及开放访问。
🚀 快速开始
# Clone the repository
git clone https://github.com/Lightricks/LTX-2.git
cd LTX-2
# Set up the environment
uv sync --frozen
source .venv/bin/activate
所需模型
请从 LTX-2.3 HuggingFace 仓库 下载以下模型:
LTX-2.3 模型检查点(选择并下载其中一个)
空间上采样器 - 本仓库当前两阶段流水线实现所需
时间上采样器 - 模型支持,未来流水线实现将需要
蒸馏 LoRA - 本仓库当前两阶段流水线实现所需(DistilledPipeline、ICLoraPipeline 和 LipDubPipeline 除外)
Gemma 文本编码器(从仓库下载所有资产)
LoRA 模块
LTX-2.3-22b-IC-LoRA-Union-Control- 下载LTX-2.3-22b-IC-LoRA-Motion-Track-Control- 下载LTX-2-19b-IC-LoRA-Detailer- 下载LTX-2-19b-IC-LoRA-Pose-Control- 下载LTX-2-19b-LoRA-Camera-Control-Dolly-In- 下载LTX-2-19b-LoRA-Camera-Control-Dolly-Left- 下载LTX-2-19b-LoRA-Camera-Control-Dolly-Out- 下载LTX-2-19b-LoRA-Camera-Control-Dolly-Right- 下载LTX-2-19b-LoRA-Camera-Control-Jib-Down- 下载LTX-2-19b-LoRA-Camera-Control-Jib-Up- 下载LTX-2-19b-LoRA-Camera-Control-Static- 下载LTX-2.3-22b-IC-LoRA-HDR- HDR IC-LoRA 以及HDRICLoraPipeline的预计算文本嵌入LTX-2.3-22b-IC-LoRA-LipDub- 下载
可用流水线 (Pipeline)
- TI2VidTwoStagesPipeline - 生产级质量的文本/图像到视频生成,配合 2 倍上采样(推荐)
- TI2VidTwoStagesHQPipeline - 与上述相同两阶段流程,但使用 res_2s 二阶采样器(更少步数,更高质量)
- TI2VidOneStagePipeline - 单阶段生成,适用于快速原型开发
- DistilledPipeline - 最快推理,使用 8 个预定义 sigma
- ICLoraPipeline - 视频到视频及图像到视频的变换(使用蒸馏模型)
- KeyframeInterpolationPipeline - 在关键帧图像之间进行插值
- A2VidPipelineTwoStage - 以输入音频为条件的音频到视频生成
- RetakePipeline - 重新生成现有视频的特定时间区域
- HDRICLoraPipeline - 带 HDR 输出的视频到视频变换(通过 LogC3 逆解码得到线性浮点帧,适用于 EXR 导出和色调映射)
- LipDubPipeline - 唇形配音、措辞改写、匹配说话人身份(蒸馏模型,单个 IC-LoRA,两阶段)
⚡ 优化提示
- 使用 DistilledPipeline - 仅需 8 个预定义 sigma 即可实现最快推理(阶段 1 共 8 步,阶段 2 共 4 步)
- 启用 FP8 量化 - 降低内存占用:
--quantization fp8-cast(CLI)或quantization=QuantizationPolicy.fp8_cast()(Python)。Fp8-cast 应与 bf16 检查点配合使用,它会在运行时降级。对于搭载 TensorRT-LLM 的 Hopper GPU,使用--quantization fp8-scaled-mm进行 FP8 标量矩阵乘法。Fp8-scaled-mm 应与 fp8 检查点配合使用。 - 安装注意力优化 - 在数据中心级 Blackwell GPU(B200)上,手动安装 FlashAttention 4:
uv pip install 'flash-attn-4==4.0.0b9'(此特定版本是我们在 torch 2.9.1+cu128 上验证过的;更新的 beta 版本在消费级 Blackwell 上存在已知问题)。在其他 CUDA GPU(包括 Hopper)上,使用 xFormers(uv sync --extra xformers)。 - 使用梯度估计 - 将推理步数从 40 减少至 20-30,同时保持质量(参见 流水线文档)
- 跳过内存清理 - 如果 VRAM 充足,可禁用阶段间的自动内存清理以加快处理速度
- 选择单阶段流水线 - 当不需要高分辨率时,使用
TI2VidOneStagePipeline以获得更快的生成
✍️ 为 LTX-2 编写提示词 (Prompt)
编写提示词时,请专注于对动作和场景的详细、按时间顺序的描述。要包含具体的运动、外观、镜头角度和环境细节——全部放在一个连续的段落中。直接以动作开头,保持描述直白而精准。想象一位电影摄影师在描述镜头列表。字数控制在 200 以内。为获得最佳效果,请按以下结构构建提示词:
- 以一句话描述主要动作开始
- 添加关于运动和手势的具体细节
- 精确描述角色/物体的外观
- 包含背景和环境细节
- 指定镜头角度和运动
- 描述光线和色彩
- 注明任何变化或突然事件
有关编写提示词的更多指导,请参阅 https://ltx.video/blog/how-to-prompt-for-ltx-2
自动提示词增强
LTX-2 流水线通过 enhance_prompt 参数支持自动提示词增强。
🔌 ComfyUI 集成
要在 ComfyUI 中使用我们的模型,请按照 https://github.com/Lightricks/ComfyUI-LTXVideo/ 的说明操作。
📦 包 (Packages)
本仓库采用 monorepo 结构,包含三个主要包:
- ltx-core - 核心模型实现、推理栈及工具
- ltx-pipelines - 文本到视频、图像到视频及其他生成模式的高级流水线实现
- ltx-trainer - 用于 LoRA、全参数微调和 IC-LoRA 的训练与微调工具
每个包都包含自己的 README 和文档。请参阅下面的文档部分。
📚 文档
每个包都包含全面的文档:
- LTX-Core README - 核心模型实现、推理栈及工具
- LTX-Pipelines README - 高级流水线实现及使用指南
- LTX-Trainer README - 训练与微调文档,附详细指南