三元大语言模型突破1.58比特障碍

一篇 arXiv 论文指出,三元大模型权重里“0”的比例最高可达 51.5%,据此提出的 BITCOS 存储布局把实测存储位宽压到最低 1.485 比特/权重,打破了常见的 1.58 比特门槛,并带来最高约 1.28 倍的推理加速。

一句话看懂:一篇 arXiv 论文指出,三元大模型权重里“0”的比例最高可达 51.5%,据此提出的 BITCOS 存储布局把实测存储位宽压到最低 1.485 比特/权重,打破了常见的 1.58 比特门槛,并带来最高约 1.28 倍的推理加速。

事件核心:发生了什么

英特尔研究者 Evangelos Georganas、Alexander Heinecke、Pradeep Dubey 于 2026 年 9 月 14 日在 arXiv 发布论文《Breaking the 1.58-bit Barrier for Ternary LLMs》。三元大语言模型把每个权重存为 {-1, 0, +1} 三种符号之一,理论上限来自 log₂3≈1.585 比特/权重,但由于工程上采用五进制打包(5 个三值权重塞进 1 字节)并按 2 的幂分组,实际位宽被抬高到 1.625 比特/权重,前提是三种符号出现概率相同。

作者测量了 29 个三元模型的实际符号分布,发现“0”占比最高达到 51.5%,三符号等概率的假设不成立。基于此,他们提出 BITCOS:一个“密集存在位图 + 紧凑符号向量”的分布自适应布局,在零密度为 z 时,每权重成本约为 2−z 比特。结果显示,BITCOS 在 29 个模型中的 26 个上比五进制打包更省空间,最稀疏的模型上达到 1.485 比特/权重,并给出了 AVX-512、AVX2 和 Intel Xe2 GPU 上的优化解包序列。

为什么重要

三元量化是当前压低大模型推理成本的重要路线,权重越小,内存占用和带宽压力越低。此次工作的价值不在于重新定义信息论下限,而在于指出“理论最优”和“工程实现”之间存在可回收的空间:真实模型的权重分布本身偏稀疏,继续沿用等概率打包等于白白浪费存储和带宽。在实测三元矩阵-向量乘法内核上,BITCOS 相对现有生产级内核最高提升 1.28 倍;端到端解码吞吐在 CPU 上最高提升 1.18 倍,在集成与独立 Xe2 GPU 上最高提升 1.27 倍。对以推理成本为竞争焦点的大模型厂商和云服务商来说,这类低层存储与内核优化是可直接转化的算力账。

对用户/开发者/创作者的影响

目前公开信息显示,这是一篇研究论文而非已发布的产品或 API。对开发者而言,最直接的信号是:三元模型的部署格式可能存在重新设计的空间,尤其是自研推理栈、端侧部署和边缘推理场景,BITCOS 的解包路径已经覆盖 AVX-512、AVX2 和 Intel Xe2,具备在现有 CPU/GPU 上落地的条件。对使用本地大模型的创作者来说,更低的权重位宽意味着同等显存或内存可以装下更大的模型,或换取更高的生成速度;对企业和云厂商,推理吞吐的提升会直接反映在单位 token 成本上。不过这些收益能否兑现,取决于推理框架、量化工具链是否跟进支持这种非标准布局。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是 BITCOS 是否会被主流推理框架(如 llama.cpp、vLLM 等)或量化工具链采纳,形成事实标准;二是三元模型训练端的权重分布能否被进一步引导得更稀疏,从而放大这种布局的收益;三是英特尔之外,AMD、英伟达及其他芯片平台是否给出对应的解包优化,决定该方案是局部优化还是通用方向。

来源:arxiv.org

celebrityanime
celebrityanime
文章: 23964

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注