KTransformers:2024 - 2026 更新全揭秘,实现大语言模型推理/微调高效优化!
概述KTransformers 是一个专注于通过 CPU - GPU 异构计算实现大语言模型高效推理和微调的研究项目。目前该项目从 kt - kernel 源码树中开放了面向用户的推理和监督微调SFT两项功能。 更新日志2026 年 6 月 21 日支持 MiniMax - M3 首日使用教程2026 年 6 月 17 日支持 GLM - 5.2 首日使用教程2026 年 5 月 6 日 KTransformers 亮相 2026 年巴黎 GOSIM 会议 — “边缘智能体 AI” 赛道展示 KT 在消费级硬件上的推理性能2026 年 5 月 2 日支持 DeepSeek - V4 - Flash教程2026 年 4 月 30 日 KTransformers v0.6.1 刷新 kt - kernel 推理和 SFT 文档并分别设置推理和 SFT 快速入门入口2026 年 3 月 26 日支持仅使用 AVX2 的 CPU 后端进行 KT - Kernel 推理教程2026 年 2 月 13 日支持 MiniMax - M2.5 首日使用教程2026 年 2 月 12 日支持 GLM - 5 首日使用教程2026 年 1 月 27 日支持 Kimi - K2.5 首日使用教程SFT 教程2026 年 1 月 22 日支持 CPU - GPU 专家调度、原生 BF16 和每通道 FP8 精度以及 AutoDL 统一微调与推理2025 年 12 月 24 日支持原生 MiniMax - M2.1 推理教程2025 年 12 月 22 日支持使用 LLaMA - Factory 进行 RL - DPO 微调教程2025 年 12 月 5 日支持原生 Kimi - K2 - Thinking 推理教程2025 年 11 月 6 日支持 Kimi - K2 - Thinking 推理教程和微调教程2025 年 11 月 4 日 KTransformers 微调与 LLaMA - Factory 集成教程2025 年 10 月 27 日支持昇腾 NPU教程2025 年 10 月 10 日集成到 SGLang路线图、博客2025 年 9 月 11 日支持 Qwen3 - Next教程2025 年 9 月 5 日支持 Kimi - K2 - 0905教程2025 年 7 月 26 日支持 SmallThinker 和 GLM4 - MoE教程2025 年 7 月 11 日支持 Kimi - K2教程2025 年 6 月 30 日支持 3 层GPU - CPU - 磁盘前缀缓存重用2025 年 5 月 14 日支持英特尔 Arc GPU教程2025 年 4 月 29 日支持 AMX - Int8、AMX - BF16 和 Qwen3MoE教程2025 年 4 月 9 日实验性支持 LLaMA 4 模型教程2025 年 4 月 2 日支持多并发教程2025 年 3 月 15 日支持 AMD GPU 上的 ROCm教程2025 年 3 月 5 日支持 unsloth 1.58/2.51 位权重和 IQ1_S/FP8 混合权重在 24GB 显存下为 DeepSeek - V3 和 R1 支持 139K 更长上下文2025 年 2 月 25 日为 DeepSeek - V3 和 R1 支持 FP8 GPU 内核支持更长上下文2025 年 2 月 15 日更长上下文24GB 显存下从 4K 提升到 8K且速度稍快15%最高达 16 个词元/秒更新文档和在线书籍2025 年 2 月 10 日在单24GB 显存/多 GPU 和 382G DRAM 上支持 Deepseek - R1 和 V3速度最高提升 3 - 28 倍详细展示案例和复现教程见此处2024 年 8 月 28 日将 DeepseekV2 所需显存从 21G 降至 11G2024 年 8 月 15 日更新注入和多 GPU 的详细教程2024 年 8 月 14 日支持 llamfile 作为线性后端2024 年 8 月 12 日支持多 GPU支持新模型 mixtral 8*7B 和 8*22B支持 GPU 上的 q2k、q3k、q5k 反量化2024 年 8 月 9 日支持 Windows 原生系统。 功能 推理 - 高性能 kt - kernel 服务为异构大语言模型推理提供 CPU 优化的内核操作。关键特性针对 INT4/INT8 量化推理采用英特尔 AMX 和 AVX512/AVX2 优化内核实现 AMX/AVX 加速。通过支持 NUMA 的内存管理实现高效的混合专家推理进行混合专家MoE优化。CPU 端支持 INT4/INT8 量化权重GPU 端支持 GPTQ 的量化支持。为 SGLang 和其他框架提供简洁的 Python API易于集成。快速开始cd kt - kernelpip install .应用场景用于大型 MoE 模型的 CPU - GPU 混合推理。与 SGLang 集成用于生产服务。实现异构专家放置热门专家放在 GPU冷门专家放在 CPU。性能示例模型硬件配置总吞吐量输出吞吐量DeepSeek - R1 - 0528 (FP8)8×L20 GPU Xeon Gold 6454S227.85 词元/秒87.58 词元/秒8 路并发[ 完整文档](链接待补充) 监督微调SFT - 与 LLaMA - Factory 进行微调KTransformers 与 LLaMA - Factory 集成用于超大型 MoE 模型的微调。关键特性通过 INT8/INT4 量化实现 CPU/GPU 混合微调支持多后端。在有限的 GPU 内存下微调如 DeepSeek - V3/R1 等模型支持超大型 MoE。在基准测试的 MoE SFT 工作负载中训练速度比 ZeRO - Offload 快 6 - 12 倍。在基准测试设置中CPU 内存约为之前 KT SFT 路径的一半具备更低的 CPU 内存。与流行的微调框架无缝集成实现 LLaMA - Factory 集成。性能数据模型GPU 内存训练速度硬件DeepSeek - V3约 80GB 总计3.7 迭代/秒4x RTX 4090DeepSeek - R1约 80GB 总计3.7 迭代/秒4x RTX 4090Qwen3 - 30B - A3B约 24GB 总计8 迭代/秒1x RTX 4090快速开始cd /path/to/LLaMA - Factorypip install -e .pip install -r requirements/ktransformers.txtCUDA_VISIBLE_DEVICES 0,1,2,3 accelerate launch \ --config_file examples/ktransformers/accelerate/fsdp2_kt_int8.yaml \ src/train.py \ examples/ktransformers/train_lora/qwen3_5moe_lora_sft_kt.yaml[ 快速开始](链接待补充) [ 完整文档](链接待补充) 引用如果您在研究中使用了 KTransformers请引用我们的论文inproceedings{10.1145/3731569.3764843, title {KTransformers: Unleashing the Full Potential of CPU/GPU Hybrid Inference for MoE Models}, author {Chen, Hongtao and Xie, Weiyu and Zhang, Boxin and Tang, Jingqi and Wang, Jiahao and Dong, Jianwei and Chen, Shaoyuan and Yuan, Ziwei and Lin, Chen and Qiu, Chengyu and Zhu, Yuening and Ou, Qingliang and Liao, Jiaqi and Chen, Xianglin and Ai, Zhiyuan and Wu, Yongwei and Zhang, Mingxing}, booktitle {Proceedings of the ACM SIGOPS 31st Symposium on Operating Systems Principles}, year {2025} } 贡献者与团队由清华大学 MADSys 实验室、Approaching.AI、9#AISoft 社区贡献者开发和维护。我们欢迎贡献请随时提交问题和拉取请求。 社区与支持GitHub 问题报告错误或请求功能微信群见 archive/WeChatGroup.png KT 原始代码原始集成的 KTransformers 框架已存档到 archive/ 目录以供参考。目前该项目从 kt - kernel 源码树中整理出上述两项功能以便更清晰地编写文档和进行维护。有关包含完整快速入门指南和示例的原始文档请参阅archive/README.md英文archive/README_ZH.md中文