动态

运行Kimi K2 1T模型技术进展,包括量化与RDMA提速

运行Kimi K2 1T模型技术进展,包括量化与RDMA提速
Awni Hannun
我6个月前发的关于运行Kimi K2(1T参数)的帖子今天早些时候在HN上火了。当时我在2台M3 Ultra上使用mlx-lm的pipeline并行运行4位量化版本,速度相当快(约15 tok/sec)。此后有两个重大改进:1. Kimi在11月发布了改进版1T模型,包含4位QAT训练,因此模型更好,可以在Q4下运行而不损失质量。见https://x.com/awnihannun/status/1986601104130646266?s=20……2. Tahoe 26.2中推出了基于TB5的低延迟RDMA。因此,我们很快将在mlx-lm中使用tensor并行运行该模型,在2台或更多M3 Ultra上速度会显著提升。
动态Awni Hannun2025-12-14原文

相关内容