Swiftlet 把 80B 量级 Qwen 巨兽塞进 Mac:峰值内存仅 4.3GB,iPhone 17 还能原生机跑 35B

Swiftlet 是一个专为 Qwen3 系列 MoE 模型打造的 Swift + Metal 运行框架,通过把专家权重放在 SSD 上按需读取,让 80B 级模型在 Mac 上峰值内存仅 4.3GB,并首次实现了 35B 级模型在 iPhone 17 上原生机跑,不再依赖服务器。

一句话看懂:Swiftlet 是一个专为 Qwen3 系列 MoE 模型打造的 Swift + Metal 运行框架,通过把专家权重放在 SSD 上按需读取,让 80B 级模型在 Mac 上峰值内存仅 4.3GB,并首次实现了 35B 级模型在 iPhone 17 上原生机跑,不再依赖服务器。

事件核心:发生了什么

Swiftlet 是一个面向 Qwen3-Next、Qwen3.5/3.6 系列 MoE 模型的端侧推理运行时,核心思路是:把注意力、路由、共享专家等稠密权重常驻内存,而体积庞大的路由专家权重存放在 SSD 上,按需流式读取。开发者在 M5 Mac 上实测,4-bit 版 Qwen3.6-35B-A3B 磁盘占用 18GB,峰值内存仅 2.6GB,解码速度 7~11 token/s;4-bit 版 Qwen3-Next-80B-A3B 磁盘占用 42GB,峰值内存 4.3GB,速度 4.5~5 token/s。35B 版本在 iPhone 17 上内存占用约 2.5GB,速度约 1 token/s,据称是首次让这类模型在不访问服务器的情况下原生跑在手机上。

该项目的工程细节包括:80B 版每层为每个 token 路由到 512 个专家中的 10 个,35B 版为 256 个中的 8 个;专家权重被打包成固定步长数据块(.qpack),读取一个专家只需一次 SSD pread 操作,不使用 mmap,也不扰动页缓存;缓存替换采用 LFU 加近期性策略,命中率 43%~70%。所有前向计算在 Metal 上通过运行时编译的 shader 执行,同一套代码可直接部署到 iOS。Swiftlet 同时提供库、命令行工具、OpenAI 兼容服务器和 iOS 应用四类形态,开发者也确认,每个 token 实际激活约 3B 参数,因此模型在对话和写作上体现大模型能力,但事实记忆仍接近小模型。

为什么重要

Swiftlet 的意义不在于“把模型变小”,而在于重新分配了算力与存储的边界。它证明了 MoE 模型的推理瓶颈不一定是内存容量,只要调度足够细、存储读取足够高效,SSD 可以成为大模型推理的扩展内存。这对端侧 AI 的硬件路线有直接影响:未来端侧模型的规格下限可能从“手机能装多大”转变为“ SSD 能读多快、路由能跳多准”。

对行业格局而言,这类运行时的出现会降低“本地运行大模型”的硬件门槛,也让 Qwen 这类开源 MoE 模型在消费级设备上获得实际可用性。苹果设备上的开发者不再需要依赖云端 API,就能打造隐私性更强的本地 AI 应用。不过,开发者也坦承参数激活规模有限、事实记忆偏弱,这限制了它在知识密集型场景下的表现。

对用户/开发者/创作者的影响

对普通用户,最直接的变化是未来可能用 iPhone 或 Mac 原生运行 Qwen3.5/3.6 系列模型,聊天和写作类任务可以完全离线完成,隐私性更好。对开发者,SwiftletCore 提供了可嵌入任意 macOS/iOS 应用的 Swift 库,支持流式增量输出和会话缓存;命令行工具支持从 Hugging Face 断点续传、将 MLX 检查点打包为 .qpack 容器;swiftlet-server 则暴露 OpenAI 兼容接口,意味着现有 OpenAI SDK 或聊天前端可以无缝切换到本地模型。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对创作者和依赖内容生成的团队,本地运行的好处是可自由处理敏感数据、无需按 token 付费,并能在无网环境中使用。但要注意吞吐量有限,35B 在 iPhone 上约 1 token/s,只适合等待容忍度较高的轻度交互;Mac 上的 80B 版约 5 token/s,可用于离线写作辅助和批量文本处理。

值得关注的后续

目前公开信息显示,Swiftlet 已支持 Qwen3-Next 和 Qwen3.5/3.6 系列,未来是否扩展到其他 MoE 架构是第一个观察点。第二个看点是缓存策略与闪存性能的适配,现有命中率在 43%~70%,如果后续型号使用更慢的存储,速度衰减是否明显需要实测。第三,开发者明确说每次 token 只激活约 3B 参数,这种“对话像大模型、记忆像小模型”的特性会不会成为端侧 MoE 的普遍取舍,值得进一步观察。

来源:AIbase

celebrityanime
celebrityanime
文章: 16839

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注