DeepSeek v4.1 flash 在 2020 款 16GB M1 Mac Mini 上每 token 耗时 23 秒

有开发者在 16GB 内存的 2020 款 M1 Mac Mini 上,用本地方式跑起了 DeepSeek V4.1 flash,但首 token 等待 108 秒、之后每生成一个 token 约 23 秒。这说明超大模型在消费级硬件上“能跑”和“能用”之间,仍隔着很远的距离。

一句话看懂:有开发者在 16GB 内存的 2020 款 M1 Mac Mini 上,用本地方式跑起了 DeepSeek V4.1 flash,但首 token 等待 108 秒、之后每生成一个 token 约 23 秒。这说明超大模型在消费级硬件上“能跑”和“能用”之间,仍隔着很远的距离。

事件核心:发生了什么

开发者 FP4 Brain 在 X 上分享称,他让 DeepSeek V4.1 flash 在 16GB 内存的 2020 款 M1 Mac Mini 上实现了本地推理。做法是使用原始 FP4/FP8 权重,通过 SSD 流式加载,并搭配自研的 MLX runner。

关键数据有两个:首 token 延迟(TTFT)为 108 秒;此后平均每生成一个 token 约耗时 23 秒。作者特意强调单位是“秒每 token”,而不是常见的“每秒 token”——按 23 秒/token 计算,生成一百个 token 需要接近 40 分钟。

为什么重要

这条消息的价值不在于“本地大模型又突破了”,而在于它划出了当前开源大模型在消费级硬件上的边界。DeepSeek 系列一向以开源权重和较高推理效率受到关注,但 V4.1 flash 这类规模的模型,即便经过 FP4/FP8 低精度量化,仍需要远超 16GB 统一内存的资源。

SSD 流式加载本质上是用存储换内存:把放不下的权重暂存在硬盘上,按需读取。这能绕过内存上限,但代价是 I/O 带宽成为新的瓶颈,直接反映在 23 秒/token 的速度上。对比云端 API 或 4090、Mac Studio 等设备上的推理,这个结果说明“本地可运行”和“可交互使用”是两个不同命题。

对用户/开发者/创作者的影响

对开发者而言,这类实验的参考意义在于工程路径:MLX、低精度权重和 SSD 流式加载的组合,证明了小内存设备可以完成模型加载和单次推理,但不适合任何实时对话、批量生成或 AI 应用集成场景。如果你的目标是在 Mac 上做本地模型开发,目前更现实的仍是参数量更小的模型,或换用内存更大的机器。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对普通用户和创作者来说,暂时不必期待“老 Mac 本地跑顶级大模型”成为可用的产品体验。现阶段要获得稳定的推理速度,云端 API 仍是主流选择;本地推理的优势集中在隐私、离线与成本可控,但前提是硬件规格匹配。

值得关注的后续

一是这类实验能否通过更激进的量化、KV cache 优化或更高效的流式加载方案,把延迟压到可接受区间。二是 DeepSeek 官方是否会对 V4.1 flash 给出更明确的本地部署硬件建议。三是 MLX 生态及社区 runner 是否会针对低内存设备形成标准化工具链。目前公开信息显示,这些都还停留在个人实验阶段,尚无产品化或官方支持的时间表。

来源:Hacker News · 24h最热

celebrityanime
celebrityanime
文章: 23054

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注