NVIDIA量化Gemma 4 31B,精度损失极小,支持本地运行
🚨突发:NVIDIA刚刚在Hugging Face上量化了Gemma 4 31B🔥
NVFP4压缩 = 权重缩小4倍,精度保持前沿水平。
✅GPQA基线99.7%
(75.46% vs 75.71%)。
📈256K上下文窗口。
🧐多模态(文本+图像+视频)。
vLLM就绪 + Blackwell优化。
显存需求:
⚡️仅权重:约16–21 GB
🚀日常使用:24 GB GPU可运行
📈完整256K上下文 = 32 GB VRAM最佳点(RTX 5090级消费级GPU)
这是你可以在高端设备上本地运行的31B级前沿模型。
立即尝试👉 https://t.co/0E6wO3PZN4
NVFP4压缩 = 权重缩小4倍,精度保持前沿水平。
✅GPQA基线99.7%
(75.46% vs 75.71%)。
📈256K上下文窗口。
🧐多模态(文本+图像+视频)。
vLLM就绪 + Blackwell优化。
显存需求:
⚡️仅权重:约16–21 GB
🚀日常使用:24 GB GPU可运行
📈完整256K上下文 = 32 GB VRAM最佳点(RTX 5090级消费级GPU)
这是你可以在高端设备上本地运行的31B级前沿模型。
立即尝试👉 https://t.co/0E6wO3PZN4