一句话看懂:开发者实测显示,阿里开源的通义千问 Qwen3.8 27B 模型在 Mac Studio 上能以约 14 tokens/s 的速度本地运行,虽然生成速度比前代慢一半,但回答更精炼,实际完成一次回答的总耗时反而基本持平。
事件核心:发生了什么
一位开发者在其 Mac Studio M3 Ultra(256GB 统一内存)上,对 Qwen3.8 27B 模型进行了为期 10 天的实际使用和基准测试。测试数据显示,通过 Ollama 运行的 Qwen3.8 27B(Q4_K_M 量化,占用约 17GB)生成速度为每秒约 14 个 token,而前代 qwen3.6:27b 在同机同配置下可达每秒约 28.6 个 token。不过,新模型回答同一组提示词平均仅需约 900-1000 个 token,远少于前代的 2000-3300 个 token,因此单次回答的墙钟时间(约 67 秒 vs 72 秒)几乎打平。此外,测试还验证了 Unsloth 推出的 1-bit 量化版本(6.7GB),该版本在 llama.cpp 中可跑到每秒 27 个 token,虽然事实性回答正确,但会出现反复自我质疑、无法给出最终答案的“脑损伤”现象。
为什么重要
Qwen3.8 27B 是阿里开源的一款 27.3B 参数稠密模型,采用混合注意力架构(GGUF 中架构标签为 qwen35),原生支持图像和视频理解,上下文窗口达 26 万 token,并采用 Apache 2.0 许可。官方模型卡显示其在 SWE-bench Pro 上得分为 61.7,GPQA Diamond 上为 89.2,这些数字在一年前还是前沿实验室水平。该模型发布后一周内,社区已出现将其作为付费 API 模型替代品接入编程流程的案例,且 OCR 测试者称其质量超过部分商业云服务。本次实测的价值在于首次提供了它在当前可购买的 Apple Silicon 硬件上的真实性能数据,填补了此前大量讨论中缺失的硬件实测环节,也为判断混合注意力架构在 Metal 上的优化进度提供了参考。
对用户/开发者/创作者的影响
对想本地运行大模型的开发者而言,这意味着:配备 32GB 内存的设备可以流畅运行 Q4 量化版本,16GB 内存则只能运行 Q2 量化版本;1-bit 量化版本虽小(6.7GB)且速度快,但不适合需要确定性输出的任务。需要特别注意的是,运行 Qwen3.8 27B 必须使用最近几周的 llama.cpp 构建版本,旧版本会报错“unknown model architecture: ‘qwen35’”。对于日常使用场景,如 RSS 摘要、PDF 文件名整理等后台杂务,该模型已被认为足够可靠。但对内容创作者来说,1-bit 量化版本在需要明确答案的场景下目前仍不可用。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
一是 Ollama 等运行时对混合注意力架构的 Metal 内核优化进度,这直接决定生成速度能否追上前代水平;二是阿里是否会跟进推出官方量化版本,以及 1-bit 量化方案的迭代能否解决“无法给出确定性回答”的问题;三是该模型在 SWE-bench Pro 上的表现能否在真实编程任务中持续复现,吸引更多开发者在本地环境中替换云端 API。


