在Apple Silicon上实测LLM推理速度,附带原始数据(CC BY 4.0)

Macyou 发布了在 M4 版 Mac mini 上运行主流开源大模型的实测推理速度:3B 模型达 46.7 tok/s,8B 模型约 20–22 tok/s,14B 模型约 11.7 tok/s。数据公开且可复现,为开发者评估 Apple Silicon 本地推理能力提供了真实参考。

一句话看懂:Macyou 发布了在 M4 版 Mac mini 上运行主流开源大模型的实测推理速度:3B 模型达 46.7 tok/s,8B 模型约 20–22 tok/s,14B 模型约 11.7 tok/s。数据公开且可复现,为开发者评估 Apple Silicon 本地推理能力提供了真实参考。

事件核心:发生了什么

Macyou 公开了在自家生产级 M4 Mac mini(16GB 统一内存,120 GB/s 带宽)上,使用 Ollama 0.31.2(基于 llama.cpp + Metal)测试六款主流开源模型的推理速度。每个模型以 Q4_K_M 量化、512 token 生成为条件,取三次运行中位数。结果显示:Llama 3.2 3B 生成速度 46.7 tok/s,Mistral 7B 22.8 tok/s,Qwen 2.5 7B 22.3 tok/s,Llama 3.1 8B 21.2 tok/s,DeepSeek R1 8B 20 tok/s,Qwen 2.5 14B 11.7 tok/s。提示处理速度则从 531 tok/s 到 1720 tok/s 不等。所有原始数据以 CC BY 4.0 协议在 GitHub 开放。

为什么重要

此前许多推理性能数据来自理论估算或单一厂商宣传,Macyou 的测试采用生产级硬件、标准化方法(预热、固定 prompt、多轮取中位数),提升了可信度。更重要的是,数据再次印证 Apple Silicon 本地推理速度主要受内存带宽约束:M4(120 GB/s)的实测值可以作为后续 M4 Pro(273 GB/s)、M4 Max(546 GB/s)、M3 Ultra(819 GB/s)的基线,开发者可以按带宽比例粗略估算更高端芯片的表现。这有助于厂商和开发者判断:在 Mac 本地部署 7B–14B 模型是否已具备可用性,尤其对隐私敏感、需离线推理的场景意义明显。

对用户/开发者/创作者的影响

  • 开发者:如果你在 Mac 上做 LLM 应用原型,这些数据可直接指导选型。例如,希望 20 tok/s 以上流畅交互,4GB 模型选择 7B–8B;若要求更高输出质量可上 14B 模型,但需接受约 12 tok/s 的生成速度。Ollama 生态提供现成模型库,5 分钟即可部署 OpenAI 兼容 API。
  • 普通用户:M4 Mac mini 已能流畅运行本地 8B 级别模型(如 Llama 3.1 8B),对于文档摘要、代码辅助等任务体验接近云端。14B 模型在文本生成上虽慢一档,但对于非实时任务仍可接受。
  • 企业采购:如果计划为团队配备本地推理设备,M4 Mac mini 搭配 16GB 是最低成本起点;若需要更高吞吐,可参考带宽比例预测 M4 Pro/Max 性能,但应等待实测数据。

值得关注的后续

Macyou 已预告将陆续测试 M4 Pro、M4 Max 和 M3 Ultra 机型,届时可验证内存带宽与推理速度的线性比例是否成立。另外,Qwen 2.5 14B 在 16GB 设备上仅占用约 10GB 内存,未来更大模型(如 32B、70B)在 64GB/128GB Mac 上的表现值得追踪。同样重要的是,这项公开基准的测试方法可能被社区采纳为标准化方案,推动更多厂商和平台公布可比数据,改善当前推理性能信息混乱的局面。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

来源:HN Algolia · AI 24h

celebrityanime
celebrityanime
文章: 15507

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注