开源项目

ktransformers

ktransformers

面向大模型CPU-GPU异构推理与微调的灵活框架,专注MoE模型的高效部署与训练。支持模型包括DeepSeek-V3/R1、Qwen3-MoE等,能在单卡24GB显存上运行超大模型,通过CPU-GPU协同调度实现6-12x训练加速。亮点是与SGLang和LLaMA-Factory深度集成,提供生产级推理和微调能力,性能表现突出。

README

KTransformers

体验前沿 LLM 推理/微调优化的灵活框架

🎯 概述 | 🚀 推理 | 🎓 SFT | 🔥 引用 | 🚀 路线图(2026 年第二季度)

🎯 概述

KTransformers 是一个研究项目,专注于通过 CPU-GPU 异构计算实现大语言模型的高效推理与微调。该项目现从 kt-kernel 源码树中对外提供两大用户能力:推理SFT

🔥 更新动态

  • 2026 年 6 月 21 日: MiniMax-M3 Day0 支持!(教程)
  • 2026 年 6 月 17 日: GLM-5.2 Day0 支持!(教程)
  • 2026 年 5 月 6 日: KTransformers 亮相 GOSIM Paris 2026 “Agentic AI on Edge” 议题,展示 KT 在消费级硬件上的推理性能。
  • 2026 年 5 月 2 日: DeepSeek-V4-Flash 支持!(教程)
  • 2026 年 4 月 30 日: KTransformers v0.6.1 刷新了 kt-kernel 推理与 SFT 文档,分别以 推理SFT 快速入门 作为入口。
  • 2026 年 3 月 26 日: 为 KT-Kernel 推理支持仅 AVX2 的 CPU 后端。(教程)
  • 2026 年 2 月 13 日: MiniMax-M2.5 Day0 支持!(教程)
  • 2026 年 2 月 12 日: GLM-5 Day0 支持!(教程)
  • 2026 年 1 月 27 日: Kimi-K2.5 Day0 支持!(教程) (SFT 教程)
  • 2026 年 1 月 22 日: 支持 CPU-GPU 专家调度原生 BF16 和 FP8 每通道精度 以及 AutoDL 统一微调与推理
  • 2025 年 12 月 24 日: 支持原生 MiniMax-M2.1 推理。(教程)
  • 2025 年 12 月 22 日: 支持使用 LLaMA-Factory 进行 RL-DPO 微调。(教程)
  • 2025 年 12 月 5 日: 支持原生 Kimi-K2-Thinking 推理。(教程)
  • 2025 年 11 月 6 日: 支持 Kimi-K2-Thinking 推理 (教程) 和微调 (教程)
  • 2025 年 11 月 4 日: KTransformers 微调与 LLaMA-Factory 集成。(教程)
  • 2025 年 10 月 27 日: 支持 Ascend NPU。(教程)
  • 2025 年 10 月 10 日: 集成到 SGLang 中。(路线图博客)
  • 2025 年 9 月 11 日: 支持 Qwen3-Next。(教程)
  • 2025 年 9 月 5 日: 支持 Kimi-K2-0905。(教程)
  • 2025 年 7 月 26 日: 支持 SmallThinker 和 GLM4-MoE。(教程)
  • 2025 年 7 月 11 日: 支持 Kimi-K2。(教程)
  • 2025 年 6 月 30 日: 支持三层(GPU-CPU-磁盘)前缀缓存重用。
  • 2025 年 5 月 14 日: 支持 Intel Arc GPU。(教程)
  • 2025 年 4 月 29 日: 支持 AMX-Int8、AMX-BF16 和 Qwen3MoE。(教程)
  • 2025 年 4 月 9 日: 实验性支持 LLaMA 4 模型。(教程)
  • 2025 年 4 月 2 日: 支持多并发。(教程)
  • 2025 年 3 月 15 日: 支持 AMD GPU 上的 ROCm。(教程)
  • 2025 年 3 月 5 日: 支持 unsloth 1.58/2.51 bits 权重以及 IQ1_S/FP8 混合 权重。支持 DeepSeek-V3 和 R1 在 24GB VRAM 下 139K 超长上下文
  • 2025 年 2 月 25 日: 为 DeepSeek-V3 和 R1 支持 FP8 GPU 内核超长上下文
  • 2025 年 2 月 15 日: 超长上下文(24GB VRAM 下从 4K 到 8K)和略微更快的速度(+15%,最高 16 Tokens/s),更新 文档在线书籍
  • 2025 年 2 月 10 日: 在单卡(24GB VRAM)/多 GPU 和 382GB DRAM 上支持 Deepseek-R1 和 V3,加速比最高达 3~28 倍。详细演示和复现教程请见此处
  • 2024 年 8 月 28 日: 将 DeepSeekV2 所需的 VRAM 从 21G 减少到 11G。
  • 2024 年 8 月 15 日: 更新了详细的注入教程,涵盖注入和多 GPU。
  • 2024 年 8 月 14 日: 支持 llamfile 作为线性后端。
  • 2024 年 8 月 12 日: 支持多 GPU;支持新模型:mixtral 8*7B 和 8*22B;支持 GPU 上的 q2k、q3k、q5k 反量化。
  • 2024 年 8 月 9 日: 支持 Windows 原生运行。

📦 能力

🚀 推理 - 高性能 kt-kernel 服务

面向异构 LLM 推理的 CPU 优化内核操作。

image

主要特性:

  • AMX/AVX 加速:基于 Intel AMX 和 AVX512/AVX2 优化的 INT4/INT8 量化推理内核
  • MoE 优化:基于 NUMA 感知内存管理的高效 mixture-of-experts(专家混合)推理
  • 量化支持:CPU 侧 INT4/INT8 量化权重,GPU 侧 GPTQ 支持
  • 易于集成:为 SGLang 和其他框架提供简洁的 Python API

快速启动:

cd kt-kernel
pip install .

适用场景:

  • 大型 MoE 模型的 CPU-GPU 混合推理
  • 与 SGLang 集成用于生产服务
  • 异构专家部署(热门专家在 GPU,冷门专家在 CPU)

性能示例:

模型 硬件配置 总吞吐量 输出吞吐量
DeepSeek-R1-0528 (FP8) 8×L20 GPU + Xeon Gold 6454S 227.85 tokens/s 87.58 tokens/s(8 路并发)

👉 完整文档 →


🎓 SFT - 使用 LLaMA-Factory 进行微调

KTransformers × LLaMA-Factory 集成,用于超大型 MoE 模型的微调。

KTransformers SFT

主要特性:

  • 多后端支持:基于 INT8/INT4 量化的 CPU/GPU 混合微调
  • 超大型 MoE 支持:在有限的 GPU 内存上微调 DeepSeek-V3/R1 等模型
  • 比 ZeRO-Offload 更快:在基准测试的 MoE SFT 任务上实现 6-12 倍训练加速
  • 更低的 CPU 内存:在基准测试环境中,CPU 内存消耗约为先前 KT SFT 路径的一半
  • LLaMA-Factory 集成:与流行的微调框架无缝集成
模型 GPU 内存 训练速度 硬件
DeepSeek-V3 ~80GB 总计 3.7 it/s 4x RTX 4090
DeepSeek-R1 ~80GB 总计 3.7 it/s 4x RTX 4090
Qwen3-30B-A3B ~24GB 总计 8+ it/s 1x RTX 4090

快速启动:

cd /path/to/LLaMA-Factory
pip install -e .
pip install -r requirements/ktransformers.txt
CUDA_VISIBLE_DEVICES=0,1,2,3 accelerate launch \
  --config_file examples/ktransformers/accelerate/fsdp2_kt_int8.yaml \
  src/train.py \
  examples/ktransformers/train_lora/qwen3_5moe_lora_sft_kt.yaml

👉 快速入门 → 👉 完整文档 →


🔥 引用

如果您在研究中使用了 KTransformers,请引用我们的论文:

@inproceedings{10.1145/3731569.3764843,
  title = {KTransformers: Unleashing the Full Potential of CPU/GPU Hybrid Inference for MoE Models},
  author = {Chen, Hongtao and Xie, Weiyu and Zhang, Boxin and Tang, Jingqi and Wang, Jiahao and Dong, Jianwei and Chen, Shaoyuan and Yuan, Ziwei and Lin, Chen and Qiu, Chengyu and Zhu, Yuening and Ou, Qingliang and Liao, Jiaqi and Chen, Xianglin and Ai, Zhiyuan and Wu, Yongwei and Zhang, Mingxing},
  booktitle = {Proceedings of the ACM SIGOPS 31st Symposium on Operating Systems Principles},
  year = {2025}
}

👥 贡献者与团队

开发与维护者:

我们欢迎任何贡献!请随时提交 issue 和 pull request。

💬 社区与支持

📦 原版 KTransformers 代码

原有集成的 KTransformers 框架已归档至 archive/ 目录,供参考。项目现已从 kt-kernel 源码树中组织上述两大能力,以便更清晰的文档维护。

如需查看完整的快速入门指南和示例,请参见:

开源项目kvcache-ai2026-07-19原文

相关内容