vLLM-iOS:iOS 端 Multi-Agent 推理速度提升 88%

开发者 Jon Ready 发布了 vllm-ios,把大模型推理框架 vLLM 的连续批处理机制移植到 iPhone 原生 Swift 环境,在 MLX 上实现 8 个 AI 智能体并发推理,速度比 llama.cpp 快 88%。这意味着移动端跑本地大模型不再是简单的“单聊天”,而是真正开始支持多智能体协…

一句话看懂:开发者 Jon Ready 发布了 vllm-ios,把大模型推理框架 vLLM 的连续批处理机制移植到 iPhone 原生 Swift 环境,在 MLX 上实现 8 个 AI 智能体并发推理,速度比 llama.cpp 快 88%。这意味着移动端跑本地大模型不再是简单的“单聊天”,而是真正开始支持多智能体协同工作。

事件核心:发生了什么

8 月 24 日,开发者 Jon Ready 开源了 vllm-ios 项目。这是一个完全使用 Swift 编写的 iOS 推理引擎,没有 Python 依赖,底层基于苹果的 MLX 框架。核心做法是把 vLLM 的 continuous batching(连续批处理)架构移植到移动端:多个 AI 智能体共享同一次权重读取,共享的 prompt 前缀只预填充一次并缓存,每个智能体生成的 token 独立流式返回,一旦某个智能体完成推理就立即退出批次。

根据项目实测数据,在 iPhone 16 Pro 上使用 Qwen3.5-0.8B 模型,8 个智能体并发工作只需 2.9 秒即可生成 385 个 token。对比基准测试显示:4-bit 量化下,llama.cpp 从单流 54 tok/s 提升到 8 流 78 tok/s,加速比仅 1.4 倍;而 vllm-ios 从单流 103 tok/s 提升到 8 流聚合 199 tok/s,加速比达 1.9 倍。在 8-bit 量化下差距更明显,vllm-ios 达到 3.3 倍加速,而 llama.cpp 仅 2.0 倍。项目已在 GitHub 开源,仓库附带 SwarmBench 演示应用,展示了“一个问题分配给 8 个专家智能体并行回答”的场景。

为什么重要

这件事的重要性在于它解决了移动端本地大模型推理的一个结构性短板。MLX 拥有最快的 Metal 内核,但此前在 iOS 上没有多序列服务能力——一个模型只能跑一个流;llama.cpp 虽然有完善的连续批处理调度器,但其 Metal 内核在苹果 A 系列芯片上收益甚微,8 路并行只换来 1.4 倍加速。vllm-ios 用约 300 行 Swift 代码实现了 vLLM 风格的调度器,绕开修改模型代码的难题,直接复用现有内核,让端侧推理第一次同时拥有“快内核”和“好调度”。

此外,作者指出 iPhone 在高强度 GPU 负载下约 15-20 秒就会出现热降频。批处理能把这些并发请求压缩在同一个热预算窗口内完成,这是移动端 AI 推理从“能用”走向“好用”的关键。对多智能体应用来说,这直接决定了手机本地能否跑得起“一个规划者加多个执行者同时工作”的新范式。

对用户/开发者/创作者的影响

对 iOS 开发者而言,vllm-ios 提供了一个可直接集成的 Swift 推理库,无需 Python 桥接,支持 4-bit 和 8-bit 量化模型,并已实现请求按 token 边界加入、完成即退出的调度逻辑。作者测试的 batch size 2 是性价比最优区间——聚合吞吐达到峰值的 84%,单流速度仍是 batch 8 的 3.4 倍。近期它最适合的落地场景包括:多个智能体各读一份文档后做结构化抽取、对语料做 map-reduce 式并行总结、规划器与评审器并行运行,以及需要快速丢弃的推测性分支推理。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

目前公开信息显示,vllm-ios 尚未上架 App Store,需要开发者自行编译集成。它对内存也有要求——8 个并发流意味着至少能载入 8 份 KV cache 的机型才能发挥完整性能,旧款 iPhone 可能更适合 batch 2 配置。

值得关注的后续

第一,Swift 版 MLX 的多序列支持此前卡在代码评审阶段数月,vllm-ios 是否会被官方采纳或合并,值得留意。第二,项目目前的基准数据集中在 0.8B 量级的小模型,3B 以上模型在 iPhone 上的批处理表现尚待验证。第三,作者在 Mac 平台对应的 vllm-mlx 项目已在 16 请求并发时获得 4.3 倍加速,如果同样的调度思路扩散到更多端侧设备,Android 生态是否会出现类似实现,也值得观察。

来源:HN Algolia · AI 24h

celebrityanime
celebrityanime
文章: 20309

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注