动态

vLLM-Omni新增缓存加速,Diffusion推理提效2.38倍

vLLM-Omni新增缓存加速,Diffusion推理提效2.38倍
Chen Cheng
Diffusion推理成本高——vLLM-Omni现在加入了TeaCache和Cache-DiT来重用Transformer状态,无需重新训练,质量损失极小。在Qwen-Image/Qwen-Image-Edit (H200)上最高加速2.38倍。
vLLM
Diffusion服务很昂贵:每张图像需要几十个时间步,相邻步骤间存在大量冗余计算。⚡vLLM-Omni现在支持扩散缓存加速后端(TeaCache+Cache-DiT)来重用中间Transformer计算——无需重新训练,最小化 https://t.co/5v2iJORFaU
动态Chen Cheng2025-12-21原文

相关内容