📌 项目地址:kvcache-ai/ktransformers | ⭐ 18,269 颗星 | 🔧 Python | 📜 未标注
项目核心价值:在有限 GPU 上跑超大规模模型
KTransformers 是一个面向大型语言模型(LLM)推理和微调的研究项目,核心思路是 CPU-GPU 异构计算。它允许你将模型的一部分(如 MoE 专家层、KV Cache)offload 到 CPU 内存,利用 CPU 计算能力分担 GPU 负担,从而在消费级显卡上运行通常需要多张 A100 的模型。
项目近期支持了 MiniMax-M3、GLM-5.2、DeepSeek-V4-Flash、Kimi-K2.5 等最新模型,并且保持“Day0 支持”的快速跟进能力。其底层 kt-kernel 提供了推理和微调两条使用路径,并与 LLaMA-Factory、SGLang 等社区工具集成,降低了上手成本。
实际用法:从教程出发,快速体验
KTransformers 的安装和运行命令分散在多个教程文档中,以下基于 README 中明确列出的入口:
1. 推理(Inference)
先克隆仓库,然后进入 kt-kernel 子目录,根据其中的 README.md 进行安装和环境配置。例如对于 MiniMax-M3 模型,官方提供了独立的教程,会引导你下载模型文件、运行推理脚本。
典型的推理命令通常遵循类似模式(来自不同教程的示例):
# 示例:使用 KTransformers 推理 DeepSeek-V4-Flash(详见 doc/en/DeepSeek-V4-Flash.md)
python -m ktransformers --model_path /path/to/model --gpu_layers 10 --cpu_layers 20
(注意:具体参数以对应模型教程为准,上述仅示意格式)
2. 微调(SFT)
KTransformers 提供了与 LLaMA-Factory 的集成。通过 SFT 快速入门 可以启动微调任务。你可以选择标准 SFT 或 RL-DPO,都提供了详细的步骤和配置示例。
例如,启动 Kimi-K2.5 的微调需要参考 SFT Installation Guide for KimiK2.5,脚本内会处理模型切分、数据加载和参数配置。
3. 关键功能开关
- CPU-GPU Expert Scheduling:通过
--expert_schedule参数控制哪些专家层放在 GPU、哪些放在 CPU,实现显存与速度的平衡。 - Native BF16/FP8 Per Channel Precision:使用
--dtype bf16或--dtype fp8指定低精度推理,进一步降低显存需求。 - Ascend NPU 支持:对华为昇腾 NPU 有独立教程。
所有命令和教程链接均已列在项目的 README 中,你可以根据自己手中的模型直接跳转查看。
与同类工具的区别:更灵活的前沿模型支持 + 异构调度
| 特性 | KTransformers | vLLM / llama.cpp | DeepSpeed |
|---|---|---|---|
| 异构计算 | 原生支持 CPU-GPU 专家调度,可自由分配层 | llama.cpp 也支持 CPU offload,但调度粒度较粗 | 依赖 ZeRO-Offload,配置复杂 |
| 模型支持 | 跟进最新模型(MiniMax、GLM、Kimi 等),常比主流框架早数天 | 通常滞后于 Hugging Face 发布节奏 | 需要模型适配 Megatron-LM 格式 |
| 微调集成 | 与 LLaMA-Factory 深度绑定,一键启动 SFT/DPO | 推理为主,微调需借助额外工具 | 微调功能强大,但学习成本高 |
| 生态兼容 | 已集成到 SGLang(LMSys 官方博客报道) | 独立引擎,难以与 SGLang 共存 | 主要服务大企业训练场景 |
独特卖点:KTransformers 专门针对“在消费级硬件上跑最新、最难部署的模型”这一需求设计。其在 GOSIM Paris 2026 的演讲主题就是“AGENTIC AI on Edge”,直接明确目标场景。
注意事项
- 研究阶段项目:代码和 API 仍在快速迭代。README 中频繁出现“Day0 Support”以及版本 v0.6.1,意味着兼容性和文档可能不够稳定。建议在生产环境使用前充分测试。
- 硬件要求:虽然 CPU-GPU 异构降低了显存需求,但 CPU 和内存带宽仍可能成为瓶颈。官方推荐有大容量系统内存(至少 64GB)的机器,以保证模型参数和 KV Cache 的加载。
- 模型许可:大部分支持模型(如 GLM、MiniMax、Kimi)都有自己的商业使用条款,KTransformers 本身可能采用 Apache 2.0 或 MIT 许可(请查看仓库根目录 LICENSE 文件)。使用前务必确认模型合规性。
- 缺少统一文档:README 和各个子目录的教程之间可能存在信息重叠或差异。初次使用时,建议从 kt-kernel/README.md 和 SFT Quick Start 这两个入口开始,逐步深入。
如果你想用自己有限的显存跑一下最新发布的 MiniMax-M3 或 GLM-5.2,KTransformers 是目前少数能实现“Day0 体验”的框架之一。跟着它的教程走,你就能在消费级硬件上跑出这类以亿计数的模型。