AirLLM 让 70B 大模型跑在 4GB 单卡上,还支持 2.8T Kimi K3

开源项目 AirLLM 通过逐层流式加载权重,让 70B 大模型在单块 4GB GPU 上推理,并已实测支持 2.8T 参数的 Kimi K3 在 3.72GB 显存下运行。它不依赖量化、蒸馏或剪枝。

一句话看懂:开源项目 AirLLM 通过逐层流式加载权重,让 70B 大模型在单块 4GB GPU 上推理,并已实测支持 2.8T 参数的 Kimi K3 在 3.72GB 显存下运行。它不依赖量化、蒸馏或剪枝。

事件核心:发生了什么

AirLLM 是一个在 GitHub 上持续更新的开源推理框架,核心思路是把大模型按层拆分,推理时只把当前需要的层加载进显存,其他层留在硬盘或内存中。官方给出的实测数据包括:70B 模型可在 4GB 单卡运行;DeepSeek-V3 671B 约 12GB 显存;Qwen3-235B 约 3GB;Kimi K3 2.8T 约 3.72GB(RTX 6000 Ada 实测);Qwen3.8-Flash-Next 125B 约 5.95GB(RTX 4090 实测)。2026 年 9 月更新还加入了训练支持,125B 模型可在 6GB 显存下训练,27B 模型在约 2GB 显存、序列长度 512 下训练。

为什么重要

大模型推理的显存门槛一直是硬件成本的核心瓶颈。主流方案要么依赖量化压缩精度,要么需要多卡并行。AirLLM 走的是另一条路:不改变模型权重精度,靠 I/O 调度把显存需求压到极低。目前公开信息显示,它已经在消费级单卡上跑通了 671B 和 2.8T 级别的模型,这意味着开源大模型的部署门槛可能从数据中心下移到个人工作站,对算力租赁、边缘部署和学术研究都有直接影响。

对用户/开发者/创作者的影响

对开发者来说,AirLLM 提供的是类似 transformers 的 AutoModel 接口,一行代码即可切换模型,迁移成本较低,适合做原型验证或本地测试。对个人用户和小团队,手头只有 4GB 到 12GB 显存的旧卡,也可能跑起此前必须租用云端 A100 才能加载的模型。对创作者,本地跑大模型意味着数据不必上传,隐私和成本都更可控。但需要留意:逐层流式加载会带来明显的推理延迟,官方也把速度优化放在更新日志里,目前公开信息显示它更适合对延迟不敏感的离线任务。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是推理速度的实际表现,逐层加载的 I/O 开销是否会在长上下文场景中成为瓶颈;二是训练支持的成熟度,官方称 125B 可在 6GB 显存下训练,但训练稳定性和收敛效果还需社区验证;三是生态跟进,如果 Hugging Face 的 transformers 上游能直接集成类似机制,低显存推理可能从独立项目变成行业默认选项。

来源:GitHub Trending

celebrityanime
celebrityanime
文章: 28761

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注