Qwen3.6-27B减少思考token,量化适配单卡RTX 5090
RT @josefprusa: Qwen3.6-27B平均减少50%的思考token,使用ThinkingCap最佳情况下减少超过90%!
我制作了一个专为单张RTX 5090调整的INT4 AutoRound量化:在vLLM中实现2x262k上下文,TQ4 KV缓存,启用MTP,经过Hermes Agent测试。下一步推出校准更重的v2。
感谢@bottlecapai和@jaroslavbeck,我在布拉格河对岸的朋友和邻居!
另外:@UnslothAI,也很期待你们的量化版本👀
https://t.co/RFKVU1Wk06
我制作了一个专为单张RTX 5090调整的INT4 AutoRound量化:在vLLM中实现2x262k上下文,TQ4 KV缓存,启用MTP,经过Hermes Agent测试。下一步推出校准更重的v2。
感谢@bottlecapai和@jaroslavbeck,我在布拉格河对岸的朋友和邻居!
另外:@UnslothAI,也很期待你们的量化版本👀
https://t.co/RFKVU1Wk06