动态

ISTA-DASLab 实验:Qwen3-27B 分级量化,prefill 用 NVFP4、decode 用更紧凑格式

Victor M
转发 @bnjmn_marie:来自 ISTA-DASLab 的有趣实验:

Qwen3.8-27B-disaggregated-NVFP4-prefill
https://t.co/vwtBAPOKn2

Prefill 和 decode 的瓶颈不同,因此不必使用相同的量化格式。

对于 prefill,它使用 NVFP4,这非常适合快速的低精度矩阵运算。

对于 decode,它使用更紧凑的表示,以降低内存带宽需求。

该系统似乎还会按需流式加载 prefill 表示,而不是在 GPU 内存中保留两份完整的模型副本。

对于一个 Qwen3.8-27B 级别的模型,发布的 GGUF 总大小约为 13.7 GB。

这仍是实验性的。该 Hugging Face 仓库目前没有 model card,并使用自定义的 odp 架构,所以它并不是可直接替换现有 runtime 的标准 GGUF。
动态Victor M2026-09-21原文

相关内容