一句话看懂:加州理工团队创办的 PrismML 发布了 Bonsai 2 27B,把阿里开源模型 Qwen3.8 27B 压缩到 5.9 GB,内存占用降低约 9 到 10 倍,却保留了原模型 98% 的综合基准得分。这意味着接近旗舰水平的推理模型有机会跑在 PC 甚至高端手机上,而不必依赖云端。
事件核心:发生了什么
PrismML 由一群加州理工研究人员创立,CEO Babak Hassibi 是该校教授,主攻压缩技术;Databricks 联合创始人、伯克利 Sky Computing Lab 负责人 Ion Stoica 担任顾问。公司目前只拿了 2225 万美元种子轮,投资方包括 Khosla Ventures、Cerberus Capital 和加州理工。
此次发布的 Bonsai 2 27B 压缩自阿里广泛使用的开源模型 Qwen3.8 27B,体积从原始规模降到 5.9 GB,比上一代 3 月发布、匹配 95% 基准得分的 Bonsai 明显进步。公司称初代模型下载量已超 1100 万次,更小的模型另有 260 万次下载。有传闻称 PrismML 正与苹果接触,Hassibi 拒绝对此置评。
为什么重要
当前主流推理模型仍高度依赖云端算力,本地部署往往意味着性能大幅缩水。PrismML 的技术路线是“三值权重”,即把每个权重从常规 16 位压缩为 +1、-1、0 三种取值,用更少信息存储模型参数。若这条路走通,模型能力与硬件门槛之间的绑定关系会被松动,云端推理的成本结构和隐私模型也会随之变化。
赛道内并非只有它一家,Multiverse Computing 等公司也在做 LLM 压缩,且融资规模更大。PrismML 目前的差异化在于压缩后性能损失极小,不过 Hassibi 也承认,压缩总会带来一定影响,能否做到 100% 持平仍是未知数。
对用户/开发者/创作者的影响
对开发者而言,如果这类模型真能在终端本地运行,意味着不必为每次推理调用云端 API,延迟更低、数据不出设备,适合做离线助手、隐私敏感型 AI 应用。对创作者来说,本地可用的推理模型可以降低内容生成工具的使用成本和合规顾虑。不过目前公开信息显示,Bonsai 2 的实际工具链成熟度、推理速度和手机端适配情况尚未披露,距离大规模落地还有距离。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
一是 PrismML 计划未来几个月发布数百亿参数级别的压缩模型,并预计更大模型更容易保持 100% 性能,这一说法能否兑现值得跟踪。二是与苹果的接触传闻是否落地,若进入系统级设备,影响面会显著扩大。三是压缩模型的实际推理表现能否支撑真实任务,而不仅是基准分数。


