一句话看懂:Macyou 发布了在 M4 版 Mac mini 上运行主流开源大模型的实测推理速度:3B 模型达 46.7 tok/s,8B 模型约 20–22 tok/s,14B 模型约 11.7 tok/s。数据公开且可复现,为开发者评估 Apple Silicon 本地推理能力提供了真实参考。
事件核心:发生了什么
Macyou 公开了在自家生产级 M4 Mac mini(16GB 统一内存,120 GB/s 带宽)上,使用 Ollama 0.31.2(基于 llama.cpp + Metal)测试六款主流开源模型的推理速度。每个模型以 Q4_K_M 量化、512 token 生成为条件,取三次运行中位数。结果显示:Llama 3.2 3B 生成速度 46.7 tok/s,Mistral 7B 22.8 tok/s,Qwen 2.5 7B 22.3 tok/s,Llama 3.1 8B 21.2 tok/s,DeepSeek R1 8B 20 tok/s,Qwen 2.5 14B 11.7 tok/s。提示处理速度则从 531 tok/s 到 1720 tok/s 不等。所有原始数据以 CC BY 4.0 协议在 GitHub 开放。
为什么重要
此前许多推理性能数据来自理论估算或单一厂商宣传,Macyou 的测试采用生产级硬件、标准化方法(预热、固定 prompt、多轮取中位数),提升了可信度。更重要的是,数据再次印证 Apple Silicon 本地推理速度主要受内存带宽约束:M4(120 GB/s)的实测值可以作为后续 M4 Pro(273 GB/s)、M4 Max(546 GB/s)、M3 Ultra(819 GB/s)的基线,开发者可以按带宽比例粗略估算更高端芯片的表现。这有助于厂商和开发者判断:在 Mac 本地部署 7B–14B 模型是否已具备可用性,尤其对隐私敏感、需离线推理的场景意义明显。
对用户/开发者/创作者的影响
- 开发者:如果你在 Mac 上做 LLM 应用原型,这些数据可直接指导选型。例如,希望 20 tok/s 以上流畅交互,4GB 模型选择 7B–8B;若要求更高输出质量可上 14B 模型,但需接受约 12 tok/s 的生成速度。Ollama 生态提供现成模型库,5 分钟即可部署 OpenAI 兼容 API。
- 普通用户:M4 Mac mini 已能流畅运行本地 8B 级别模型(如 Llama 3.1 8B),对于文档摘要、代码辅助等任务体验接近云端。14B 模型在文本生成上虽慢一档,但对于非实时任务仍可接受。
- 企业采购:如果计划为团队配备本地推理设备,M4 Mac mini 搭配 16GB 是最低成本起点;若需要更高吞吐,可参考带宽比例预测 M4 Pro/Max 性能,但应等待实测数据。
值得关注的后续
Macyou 已预告将陆续测试 M4 Pro、M4 Max 和 M3 Ultra 机型,届时可验证内存带宽与推理速度的线性比例是否成立。另外,Qwen 2.5 14B 在 16GB 设备上仅占用约 10GB 内存,未来更大模型(如 32B、70B)在 64GB/128GB Mac 上的表现值得追踪。同样重要的是,这项公开基准的测试方法可能被社区采纳为标准化方案,推动更多厂商和平台公布可比数据,改善当前推理性能信息混乱的局面。



