Redis 作者出品;用 ds4 在本地运行 LLM

Redis 作者 antirez 发布了开源项目 DwarfStar 4(ds4),一个用 C 写成的本地大模型推理引擎,主打让 2840 亿参数的 DeepSeek V4 Flash 这类大 MoE 模型在高内存 Mac、CUDA 和 ROCm 机器上本地跑起来。

一句话看懂:Redis 作者 antirez 发布了开源项目 DwarfStar 4(ds4),一个用 C 写成的本地大模型推理引擎,主打让 2840 亿参数的 DeepSeek V4 Flash 这类大 MoE 模型在高内存 Mac、CUDA 和 ROCm 机器上本地跑起来。

事件核心:发生了什么

ds4 由 Redis 作者 antirez 推出,采用 MIT 许可,代码为纯 C,后端覆盖 Metal、CUDA 和 ROCm。它支持 DeepSeek V4 / V4.1 Flash、GLM 5.x 以及 Qwen3.8 Flash Next,包含文本与视觉模型。核心做法是非对称 2-bit 量化:压缩路由专家部分,保留关键共享路径的精度,从而让 routed-MoE 模型塞进目标机器。KV cache 按提示词前缀的 SHA1 落盘到 SSD,服务重启后匹配前缀可直接重载,不必整段重新 prefill。引擎提供三个入口:./ds4 交互式 CLI、./ds4-server 本地 API(兼容 OpenAI 和 Anthropic 格式)、./ds4-agent 原生编码 agent。官方给出参考数据:M5 Max 128GB 在 32K 上下文下约 34.4 T/s 生成、557 T/s prefill。

为什么重要

当前前沿开源权重模型的主流用法是远程托管,本地部署往往卡在显存和量化损失上。ds4 把问题反过来处理:先接受高内存机器这个约束,再用非对称量化和 SSD 流式加载把巨型 MoE 压到单机可运行。如果这套方案在真实使用中稳定,意味着开源模型与闭源 API 之间的差距,可能更多取决于能否本地持有一个足够强的模型状态,而不是单纯的参数规模。对关注推理成本、数据不出本地和长期驻留会话的团队来说,这是一条不同于“租算力调 API”的技术路线。

对用户/开发者/创作者的影响

开发者最直接的收益是接口兼容:/v1/chat/completions、/v1/messages、/v1/responses 可以接 OpenCode、Claude Code、Codex CLI、Pi 等现有工具,迁移成本低。硬件门槛方面,官方给出的内存档位从 32GB 到 512GB:64GB 可跑 Qwen,128GB 能装下 GLM 5.3 Q2 和 Qwen Q4,V4.1 Q2 则从 SSD 流式读取。创作者如果本机是高配 Apple Silicon,可以在不联网的前提下处理长文本和代码任务;企业侧则需要权衡高内存机器的采购成本与 API 调用费。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是量化后的实际质量损失,尤其是长上下文和代码任务上的退化程度,目前公开信息仅有基准吞吐数据,缺少系统评测;二是 SSD 流式和 KV cache 落盘在长时间会话中的稳定性与磁盘开销;三是生态跟进,是否有更多模型布局被纳入支持,以及本地 agent 工作流能否形成社区惯例。

来源:Hacker News (黑客新闻)

celebrityanime
celebrityanime
文章: 27024

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注