Apple Silicon 与 macOS 虚拟机:Llama.cpp 将 LLM 推理速度提升 11–16 倍

Cua 团队发现苹果 macOS 虚拟机中的虚拟 GPU 向应用上报了过于保守的 Metal 图形能力,导致 llama.cpp 在虚拟机里只能走慢速代码路径;他们用一个进程级兼容层修正能力报告后,LLM 推理速度提升 11–16 倍,接近物理机水平。

一句话看懂:Cua 团队发现苹果 macOS 虚拟机中的虚拟 GPU 向应用上报了过于保守的 Metal 图形能力,导致 llama.cpp 在虚拟机里只能走慢速代码路径;他们用一个进程级兼容层修正能力报告后,LLM 推理速度提升 11–16 倍,接近物理机水平。

事件核心:发生了什么

8 月 11 日,Cua 团队发布了一项研究:在基于苹果 Virtualization.framework 的 macOS 虚拟机上,llama.cpp 调用 Metal GPU 的路径存在严重性能浪费。问题根源不在 GPU 算力,而在于虚拟 GPU 设备向客户机系统上报的“能力值”过于保守——例如将 GPU 家族识别为 Apple 5 代、最大线程组内存上报为 32KB,并标记 SIMD 组矩阵计算不可用。llama.cpp 作为遵守规范的 Metal 应用,因此选择了更慢的内核。

团队的解决方案是一个进程级 Metal 能力兼容层(shim),只修改客户机内单个进程收到的能力查询结果,把它对 Apple 家族的支持提升到 family 9,线程组内存从 32KB 提升到 64KB。实测数据相当可观:在 M1 Ultra 上,TinyLlama 1.1B 的提示处理速度提升 11.08 倍、token 生成速度提升 16.36 倍,提示处理达到裸机性能的 98%;Google 的 Gemma 4 12B QAT Q4_0(6.98GB)提示处理提升 7.

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

celebrityanime
celebrityanime
文章: 18311

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注