我的天哪。 重磅消息,Qwen3.8-27B 本地部署大模型再降配置。 PrismML 基于 Qwen3.8-27B 做成了真三值模型 Ternary Bonsai 2 27B,27B 参数只剩 5.9GB,性能还能保留约 98.2%。 核心亮点: 1、 27B 模型压到约 5.9GB,相比 FP16 的约 54GB 缩小约 9 倍 2、 权重只有 1、0、+1 三种值,平均 1.72 bit/weight 3、 官方称可保留约 98…

PrismML 把 Qwen3.8-27B 改造成了权重只有 -1、0、+1 的真三值模型 Ternary Bonsai 2 27B,体积压到约 5.9GB,官方称仍能保留约 98.2% 的原模型性能。这意味着 27B 级别的本地大模型,开始向消费级显卡和笔记本内存靠拢。

一句话看懂:PrismML 把 Qwen3.8-27B 改造成了权重只有 -1、0、+1 的真三值模型 Ternary Bonsai 2 27B,体积压到约 5.9GB,官方称仍能保留约 98.2% 的原模型性能。这意味着 27B 级别的本地大模型,开始向消费级显卡和笔记本内存靠拢。

事件核心:发生了什么

据 @aehyok 发布的信息,PrismML 基于 Qwen3.8-27B 推出了三值量化版本 Ternary Bonsai 2 27B。其权重只保留 -1、0、+1 三种取值,平均约 1.72 bit/weight,最终 27B 参数占用约 5.9GB;作为对照,FP16 精度下同样规模约需 54GB,缩小接近 9 倍。官方称综合性能保留约 98.2%,代码和数学能力损失较小,并支持 262K 上下文,可通过 llama.cpp 在 CUDA、Metal 和 CPU 上运行。实测速度方面,RTX 5090 生成约 120–143 tok/s,Apple M5 Max 约 47 tok/s。相关模型已放在 Hugging Face 的 PrismML 集合页中。

为什么重要

三值量化并不是新概念,但把它真正落到 27B 这种中大规模模型上,且公开声称性能损失只有约 2%,才是这条消息的分量所在。过去本地部署大模型的主要瓶颈是显存:27B 级别想在本地跑,通常需要高端多卡或大内存工作站。如果 5.9GB 的体积和 98.2% 的性能保留能够被社区复现,那么本地推理的门槛会明显下降,也会进一步压缩“必须上云”的适用场景。对开源模型生态来说,这相当于是把量化从“能跑就行”推向“接近原模型可用”的阶段,和 API 调用、闭源模型形成更直接的竞争。

对用户/开发者/创作者的影响

对开发者和本地 AI 用户,最直接的变化是硬件选择变多:单张 RTX 5090 甚至 Apple M5 Max 这类统一内存设备,都可能承担过去需要更大显存才能跑的 27B 推理任务,隐私敏感场景、离线环境、企业内部部署会更容易落地。对创作者来说,262K 上下文配合本地运行,适合长文档处理、代码辅助和私有素材整理,不必把数据传到第三方 API。需要注意的是,三值模型的实际表现依赖推理框架、量化 kernel 和任务类型,目前公开信息显示其优势集中在代码和数学,通用对话、多语言和长链推理是否同样稳定,仍需更多第三方评测。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是社区能否复现官方给出的 98.2% 性能保留和 RTX 5090 速度数据,尤其是不同 batch、不同上下文长度下的表现;二是 llama.cpp 等推理框架对这类三值权重的支持是否成熟,会不会出现专门的优化分支;三是 Qwen 之外的其他开源模型是否跟进三值量化路线,以及 PrismML 后续会不会放出更小或更大的版本。

来源:@aehyok

celebrityanime
celebrityanime
文章: 24262

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注