Karpathy 草稿验证技巧迎来突破:Uzu 在 Apple M5 上跑出 117 tokens/s

2026 年 10 月 9 日,开源推理引擎 Uzu 在 Apple M5 上把 Karpathy 的投机采样思路推至一次草拟 16 个 token,同一提示词下速度达到 llama.cpp 和 MLX 的 3 至 5 倍。

一句话看懂:2026 年 10 月 9 日,开源推理引擎 Uzu 在 Apple M5 上把 Karpathy 的投机采样思路推至一次草拟 16 个 token,同一提示词下速度达到 llama.cpp 和 MLX 的 3 至 5 倍。

事件核心:发生了什么

2023 年,Andrej Karpathy 曾解释本地 LLM 缓慢的根因:单批次解码时,芯片大部分时间都在等待权重从内存搬运到计算单元,算力大量闲置。他给出的绕行方案是投机采样——小模型提前猜多个 token,主模型一次遍历验证。但此前本地实现如 llama.cpp 的 MTP 模式通常只能草拟 3 到 4 个 token。

据 2026 年 10 月 9 日社区信息,来自 Mirai 的开源推理引擎 Uzu 在 Apple Silicon 上把这一路线推进了一步:最多提前草拟 16 个 token,保持猜测之间的连贯性,并利用为 M5 编写的内核在一次遍历中完成验证。在基础版 Apple M5、4 位量化 Qwen 系列 9B 模型、同一编程提示词条件下,Uzu 写入速度达到每秒 92 到 117 个 token,而 llama.cpp 与 MLX 分别为每秒约 22 和 25 个 token,接近该芯片单遍历理论天花板约每秒 29 个 token。

为什么重要

本地大模型推理长期受限于内存带宽,而非算力,这使消费级设备的速度上限很难被纯粹优化突破。Uzu 的做法说明,在投机采样中扩大草稿窗口并保持连贯性,有可能在同等硬件上大幅拉开差距。对开源本地推理生态而言,这意味着竞争焦点正从单纯移植模型,转向针对特定芯片编写内核、优化验证效率。如果这类方法被更广泛复现,本地 AI 应用的响应体验可能明显改善,同时降低对云端 API 的依赖。

对用户/开发者/创作者的影响

目前公开信息显示,Uzu 仍属开源推理引擎项目,并非已经完成商业化的成熟产品,实际稳定性和模型覆盖范围需自行验证。对开发者,值得关注它是否支持更多量化格式和模型架构,以及与现有 llama.cpp、MLX 工作流的迁移成本。对本地部署用户,若 M5 上的速度优势可复现,运行 9B 级别模型进行代码补全、文档处理或本地智能助手会更具实用性。对创作者,更快的本地推理意味着图像生成提示词迭代、多轮对话等场景的等待时间可能缩短,但对硬件仍有一定要求。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是 Uzu 是否从基准测试走向稳定可用的正式版本,并公开完整评测条件;二是 llama.cpp 和 MLX 等主流本地推理框架是否会跟进扩大草稿 token 数量或优化 M5 内核;三是除 Apple Silicon 外,该方案在 x86、NPU 或其他加速器上的移植效果,这决定它能否真正影响更广泛的本地 AI 部署。

来源:社区更新 · 2026-10-11

celebrityanime
celebrityanime
文章: 28806

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注