动态

llama.cpp MTP支持本地模型提速78%

AK
带有MTP支持的llama.cpp使得本地模型足够快,可作为日常驱动 🚀

Qwen3.6-27B密集生成(在A10G上):
从25 tok/s 提升到45 tok/s(+78%)。

llama-server的两个标志:
--spec-type draft-mtp --spec-draft-n-max 2 https://t.co/hhslKpLE71
Georgi Gerganov
llama.cpp为Qwen3.6家族添加了MTP支持

这对本地AI生态系统是一个重要的里程碑。这些改变带来的性能提升巨大,进一步提升了在商用硬件上的本地推理能力。

特别感谢Aman Gupta领导了这一开发!
动态AK2026-05-19原文

相关内容