Qwen3.5发布GPTQ-Int4权重,支持长上下文
终于——是的,终于——我们的GPTQ-Int4权重来了 🔥 Qwen3.5系列在4位权重和KV缓存量化下保持了近乎无损的精度。在长上下文效率方面:• Qwen3.5-27B支持80万+上下文长度 • Qwen3.5-35B-A3B在32GB显存的消费级GPU上超过100万上下文 • Qwen3.5-122B-A10B在80GB显存的服务器级GPU上支持100万+上下文长度
🔥 Qwen 3.5系列GPTQ-Int4权重已上线。原生支持vLLM和SGLang。⚡️更少显存,更快推理。在有限GPU配置上运行强大模型。👇获取权重和示例代码:Hugging Face:https://t.co/3MSb7miq68 ModelScope:https://t.co/LGHruBHP6Q