作者成功在vLLM实现混合精度量化,结果良好,后续计划更多精度。
终于让 vLLM 稳定支持混合精度量化(2、3、4、8 位),初步结果非常乐观。其实没什么高深的,就是把几个工具拼起来:AutoRound、LLM Compressor、自制的 repacker,还有 vLLM 0.26 的 Humming Kernel。这里上传了几个量化后的 Qwen3.6 27B 模型:https://t.co/tVRrOOzzUa。我现在正在跑正式评估,下周可能会把结果发到博客上。目前 3.8 位和 4.3 位版本表现很好;3.5 位和 3.0 位还没仔细测,但至少能处理简单问题。我挺兴奋的。GGUF 之所以这么流行,一大原因是 llama.cpp 允许你在不同层混合不同的量化等级。这种灵活性可以产生比 vLLM 常用的 4 位和 8 位配置小得多的模型。但在此之前,让 vLLM 实现类似功能相当困难。还有很多可以探索的。下一步我想支持更多精度等级(5、6、7 位),量化模型更多部分(lm_head 和 token embeddings),并研究激活量化,这应该很容易。在 vLLM 解决之前,会有一个重大限制:1 位和三元层仍然不支持。还有更多工作要做,但 vLLM 的灵活混合精度量化终于开始变得实用了。