苹果统一内存卖得有多贵,大家心里都有数。 今天在 Reddit 刷到一个神级项目直接看傻了: 有人用一条 10 Gb/s 的 USB-C 线,把手里的 iPhone 变成了 24GB MacBook 的“副显卡”,用来跑本地 Qwen 27B 大模型,长文本速度暴涨 40%+! https://t.co/33zDXv5E1E

一个名为 backburner 的开源项目,让 Mac 通过 USB-C 借调 iPhone 的 GPU 与内存,把 24GB 机器跑 Qwen 27B 大模型的长上下文推理速度拉高了 35%–44%。它提供的思路比性能数字更值得关注:苹果设备之间闲置的算力,第一次被民间方案真正串了起来。

一句话看懂:一个名为 backburner 的开源项目,让 Mac 通过 USB-C 借调 iPhone 的 GPU 与内存,把 24GB 机器跑 Qwen 27B 大模型的长上下文推理速度拉高了 35%–44%。它提供的思路比性能数字更值得关注:苹果设备之间闲置的算力,第一次被民间方案真正串了起来。

事件核心:发生了什么

根据 @mylifcc 在 X 上的整理,Reddit 用户开源了名为 backburner 的项目:在一台 24GB 统一内存的 Mac 上,通过一条 10Gb/s 的 USB-C 线连接 iPhone,由 Mac 负责 1–40 层计算,iPhone 接力 41–64 层,中间张量走 USB-C 传输。上下文超过 64k 后,旧 KV Cache 还会卸载到 iPhone 内存,占用接近 6GB。

实测数据是:8k 上下文 Prefill 从 132 提升到 177 tok/s(+35%),16k 从 109 提升到 157 tok/s(+44%),27k token 冷启动读取从 228 秒缩短到 168 秒。代码已在 GitHub 开源。

为什么重要

在本地跑 Qwen 27B 这类模型,瓶颈通常不是单点算力,而是统一内存容量。24GB Mac 遇到 64k 上下文就会 OOM,而苹果把 36GB、48GB 内存卖到天价,等于把长上下文推理变成了硬件升级问题。backburner 的意义在于绕过这条路径:用现有设备的闲置 NPU/GPU 和内存做分布式推理,验证了“设备互联 + 流水线分层”在消费级硬件上可行。

这也反衬出苹果生态的一个空白——官方长期把多设备协同停留在隔空投送、接力这类轻量功能,没有面向 AI 推理做算力池化。开源社区先手搓出来了,目前公开信息显示它仍是实验性项目,而非成熟产品。

对用户/开发者/创作者的影响

对已有 Mac 和 iPhone 的用户,这提供了一个不换机就能扩展推理能力的可能,尤其是经常处理长文档、长代码库的开发者。对本地大模型生态,它指向一条新路线:模型分层、KV Cache 异地存放、跨设备 Pipeline Parallelism,可能被更多推理框架借鉴。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

需要冷静的是,10Gb/s 的 USB-C 带宽仍是硬约束,层间传输和序列化开销决定了它更适合 Prefill 加速和冷启动读取,未必能线性提升持续生成速度。另外,这条方案高度依赖苹果的统一内存架构,换到 Windows 或安卓设备上没有直接对应物。

值得关注的后续

一是项目能否从跑通走向稳定,比如是否支持更多模型、是否降低对特定芯片代际的依赖;二是带宽瓶颈会不会被雷电 5 或更高规格接口突破;三是苹果是否会在系统层面回应这种“非官方算力扩展”,还是继续用内存定价维持高端机型溢价。

来源:@mylifcc

celebrityanime
celebrityanime
文章: 27358

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注