行业新闻

vLLM-Omni 优化 MiniMax H3 服务:FastH3 将 49 次 DiT 前向减至 4 次

这篇讲的是如何把 MiniMax H3 的音视频生成服务做到端到端实时:不是单点优化 DiT,而是重排整条推理流水线并叠加 4 步蒸馏式加速。

MiniMax H3 要联合生成视频和同步音频,一个请求要穿过 Qwen3-VL 编码器、长序列音视频 DiT、彼此独立的视频与音频 VAE,最后封装成 H.264/AAC 的 MP4。只优化 DiT 不够,vLLM-Omni 从整条常驻流水线下手,再由 FastVideo 的 FastH3 把 49 次 DiT 前向压缩到 4 次;八卡 B300 上产出一段 10.125 秒 MP4 用时约 8.7 秒,即端到端快于播放时长。

正文摘录

![](https://image.jiqizhixin.com/uploads/article/coverimage/8bc54565-c644-4a0a-ba0d-8403a2215a38/013(2).jpg) ![图片](https://mmbiz.qpic.cn/szmmbizpng/5L8bhP5dIqElqZ0GcgINP4V78xIEARSSDI7pRpUQpZAhGK6rr8zoMJM3icYLohdHNhq93gll1YkHwsYaOO3tolCuL5QN5gAtJc46PnNgECQI/640?wxfmt=png&from=appmsgimgIndex=0) MiniMax H3 的服务是一个系统问题。一个请求要经过一个庞大的 Qwen3-VL 编码器、一个长序列的音视频 DiT、相互独立的视频与音频 VAE、设备与进程的边界,最后还要完成 H.264/AAC 的封装。只优化 DiT,其余环节的时延依然留在那里。 因此 vLLM-Omni 从完整的常驻流水线入手:注意力与通信、融合的 DiT 算子、并行 VAE 解码、紧凑的输出传输,以及并行的 MP4 构建。随后由 FastVideo 的 FastH3 处理剩下的主导项,把 49 次 DiT 前向替换为 4 次。 在实测的八卡 B300 配置上,FastH3 产出一个 10.125 秒的完整 MP4 用时 8.678 至 8.710 秒 。本文中的 实时 指完整响应的就绪时间快于其播放时长,并不指流式交付或首帧时间。 1. 为什么 MiniMax H3 的服务是一个系统级问题 MiniMax H3 以文本、图像、视频和音频作为输入,联合生成视频与同步音频。

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-09-13原文

相关内容