介绍Kimi K2模型在M3 Ultra上运行及后续改进
这篇我6个月前关于在Kimi K2(1T参数)上运行的帖子今天在HN上热门。当时我使用mlx-lm的流水线并行,在两个M3 Ultra上运行4位量化版本,速度约15 tok/s。此后有两个重大改进:1. Kimi在11月发布了改进的1T模型,包含4位QAT训练,质量无损。见https:// x.com/awnihannun/status/1986601104130646266?s=20…… 2. Tahoe 26.2中推出低延迟RDMA over TB5,我们将很快在mlx-lm中通过张量并行运行该模型,在两个或更多M3 Ultra上速度明显提升。
Kimi K2 1T模型在两台512GB M3 Ultra上运行 https://t.co/Vv2OSCeWmi (https://t.co/B1gPCggOj7)