kvcache-ai / ktransformers

KTransformers 是一个专注于大模型 CPU-GPU 异构计算的推理与微调框架,最新更新显示它已支持 MiniMax-M3、GLM-5.2、DeepSeek-V4-Flash 等前沿模型,并持续优化在消费级硬件上的运行效率,目标是将大模型的门槛降到更低。

kvcache-ai / ktransformers

一句话看懂:KTransformers 是一个专注于大模型 CPU-GPU 异构计算的推理与微调框架,最新更新显示它已支持 MiniMax-M3、GLM-5.2、DeepSeek-V4-Flash 等前沿模型,并持续优化在消费级硬件上的运行效率,目标是将大模型的门槛降到更低。

事件核心:发生了什么

KTransformers 项目近期发布了 v0.6.1 版本,并持续更新了对多款最新模型的首日(Day0)支持,包括 MiniMax-M3、GLM-5.2、DeepSeek-V4-Flash 以及 Kimi-K2.5 等。该项目由 kvcache-ai 团队维护,核心能力分为两块:一是高性能推理(Inference),通过 kt-kernel 引擎提供 AMX/AVX 指令集加速、MoE 专家调度、CPU-GPU 异构推理等优化;二是基于 LLaMA-Factory 的微调(SFT),支持在有限 GPU 显存下对超大规模 MoE 模型进行微调,声称相比 ZeRO-Offload 方案可实现 6-12 倍训练加速。性能数据上,例如在 8 张 L20 GPU 配合 Xeon Gold 处理器上运行 DeepSeek-R1-0528(FP8),可达到 227.85 tokens/s 的总吞吐量,其中输出吞吐量为 87.58 tokens/s。

为什么重要

KTransformers 的意义在于它直面了当前大模型部署的核心矛盾:模型规模持续增长,但多数用户和企业仍受限于单机或消费级硬件的显存瓶颈。通过 CPU-GPU 异构计算、量化、MoE 专家热/冷分离等技术,它让原本需要多张昂贵 GPU 才能运行的模型(如 DeepSeek-V3/R1)可以在 24GB VRAM 的单卡甚至纯 CPU 环境下运行。这种技术路线不仅降低了推理成本,也为边缘设备或资源受限场景提供了可行方案。同时,它对 Ascend NPU、Intel Arc GPU、AMD ROCm 等非 NVIDIA 硬件的支持,有助于打破算力生态的单一依赖。

对用户/开发者/创作者的影响

对于普通开发者,KTransformers 提供了一个简洁的 Python API,可以集成到 SGLang 等推理框架中,快速实现本地或云端的高效推理。对于企业或研究团队,其 SFT 微调能力使得在 4 张 RTX 4090 上即可微调 DeepSeek-V3 这样的千亿参数模型,显存占用约 80GB,训练速度约 3.7 it/s。对于硬件受限的用户,比如仅持有旧款 Intel CPU 或 AMD 显卡的用户,项目对 AVX2 后端和 ROCm 的支持也意味着更多模型可以本地化运行。创作者和内容团队可以利用这一框架,在低成本硬件上运行超长上下文(如 139K tokens)的推理任务,用于长篇文本生成或复杂分析。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

第一,项目的 Roadmap 已更新至 2026 年 Q2,持续关注它对更多模型的 Day0 支持速度,这直接反映了框架的适配能力和社区生态活跃度。第二,KTransformers 与 SGLang 的深度整合正在推进中,这可能会改变生产级推理服务的部署模式。第三,它是否能在更多国产芯片(如昇腾、寒武纪)上获得实际性能验证,将决定该框架在中国市场的适用性。第四,目前的性能数据主要在高端多卡配置下测得,消费级单卡场景下的实际体验(如吞吐量与延迟)需要更多独立测试来印证。

来源:github

celebrityanime
celebrityanime
文章: 14356

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注