动态

NVIDIA发布NVFP4量化版Qwen3.8-Flash-Next,体积减少63%。

NVIDIA发布NVFP4量化版Qwen3.8-Flash-Next,体积减少63%。
AK
转发 @HuggingPapers:NVIDIA 刚刚在 Hugging Face 上发布了 NVFP4 量化版的 Qwen3.8-Flash-Next

125B MoE 混合注意力模型,现在体积缩小 63%,精度损失极小。
动态AK2026-09-04原文

相关内容