ISTA-DASLab 实验:Qwen3-27B 分级量化,prefill 用 NVFP4、decode 用更紧凑格式
转发 @bnjmn_marie:来自 ISTA-DASLab 的有趣实验:
Qwen3.8-27B-disaggregated-NVFP4-prefill
https://t.co/vwtBAPOKn2
Prefill 和 decode 的瓶颈不同,因此不必使用相同的量化格式。
对于 prefill,它使用 NVFP4,这非常适合快速的低精度矩阵运算。
对于 decode,它使用更紧凑的表示,以降低内存带宽需求。
该系统似乎还会按需流式加载 prefill 表示,而不是在 GPU 内存中保留两份完整的模型副本。
对于一个 Qwen3.8-27B 级别的模型,发布的 GGUF 总大小约为 13.7 GB。
这仍是实验性的。该 Hugging Face 仓库目前没有 model card,并使用自定义的 odp 架构,所以它并不是可直接替换现有 runtime 的标准 GGUF。
Qwen3.8-27B-disaggregated-NVFP4-prefill
https://t.co/vwtBAPOKn2
Prefill 和 decode 的瓶颈不同,因此不必使用相同的量化格式。
对于 prefill,它使用 NVFP4,这非常适合快速的低精度矩阵运算。
对于 decode,它使用更紧凑的表示,以降低内存带宽需求。
该系统似乎还会按需流式加载 prefill 表示,而不是在 GPU 内存中保留两份完整的模型副本。
对于一个 Qwen3.8-27B 级别的模型,发布的 GGUF 总大小约为 13.7 GB。
这仍是实验性的。该 Hugging Face 仓库目前没有 model card,并使用自定义的 odp 架构,所以它并不是可直接替换现有 runtime 的标准 GGUF。