vLLM-Omni 优化 MiniMax H3 服务:FastH3 将 49 次 DiT 前向减至 4 次
这篇讲的是如何把 MiniMax H3 的音视频生成服务做到端到端实时:不是单点优化 DiT,而是重排整条推理流水线并叠加 4 步蒸馏式加速。
MiniMax H3 要联合生成视频和同步音频,一个请求要穿过 Qwen3-VL 编码器、长序列音视频 DiT、彼此独立的视频与音频 VAE,最后封装成 H.264/AAC 的 MP4。只优化 DiT 不够,vLLM-Omni 从整条常驻流水线下手,再由 FastVideo 的 FastH3 把 49 次 DiT 前向压缩到 4 次;八卡 B300 上产出一段 10.125 秒 MP4 用时约 8.7 秒,即端到端快于播放时长。
正文摘录
.jpg)  MiniMax H3 的服务是一个系统问题。一个请求要经过一个庞大的 Qwen3-VL 编码器、一个长序列的音视频 DiT、相互独立的视频与音频 VAE、设备与进程的边界,最后还要完成 H.264/AAC 的封装。只优化 DiT,其余环节的时延依然留在那里。 因此 vLLM-Omni 从完整的常驻流水线入手:注意力与通信、融合的 DiT 算子、并行 VAE 解码、紧凑的输出传输,以及并行的 MP4 构建。随后由 FastVideo 的 FastH3 处理剩下的主导项,把 49 次 DiT 前向替换为 4 次。 在实测的八卡 B300 配置上,FastH3 产出一个 10.125 秒的完整 MP4 用时 8.678 至 8.710 秒 。本文中的 实时 指完整响应的就绪时间快于其播放时长,并不指流式交付或首帧时间。 1. 为什么 MiniMax H3 的服务是一个系统级问题 MiniMax H3 以文本、图像、视频和音频作为输入,联合生成视频与同步音频。