从3.3GB压缩到440MB!腾讯混元极低bit翻译模型如何做到几乎零损失?

腾讯混元团队将 1.8B 参数翻译模型 Hy-MT2 压缩至 440MB,体积缩减超 85% 且翻译质量几乎无损,该技术已落地 B 站直播弹幕实时翻译,证明超低比特量化可从实验室走向高并发商业场景。

一句话看懂:腾讯混元团队将 1.8B 参数翻译模型 Hy-MT2 压缩至 440MB,体积缩减超 85% 且翻译质量几乎无损,该技术已落地 B 站直播弹幕实时翻译,证明超低比特量化可从实验室走向高并发商业场景。

事件核心:发生了什么

腾讯混元团队近期公布了一项模型压缩技术进展,针对其面向端侧设备的 Hy-MT2-1.8B 翻译模型,提出了两套超低比特量化方案。原模型在 FP16 精度下需占用 3.3GB 内存,即便降至 4-bit 仍需超过 1GB,难以满足端侧多任务并发的内存管理要求。

第一套方案面向高端设备,采用 2-bit 量化,结合可伸缩弹性量化(SEQ)与量化感知蒸馏(QAD)技术,将模型体积压缩至 574MB。第二套方案为 1.25-bit 超低比特方案,基于腾讯自研的 Sherry 稀疏高效三元量化技术——该技术此前入选 ACL2026 顶会 Oral 论文。其核心是用细粒度稀疏机制,每四个参数中三个存储特定值、一个置零,使单参数平均占用仅 1.25 bit,再配合专为 CPU 设计的 STQ 内核,将模型压缩到 440MB。

目前该超低比特模型已在 B 站直播弹幕实时翻译场景中正式投入使用。整个资源下载体量约 600MB,运行内存占用 500-700MB,单条弹幕平均翻译耗时 500-800 毫秒,可处理多种网络用语,并通过本地化运行减少云端调用成本与带宽费用。

为什么重要

这项进展的意义在于将“端侧大模型”的可行性边界向前推进了一步。1.8B 模型在传统量化方案下内存占用长期卡在 1GB 以上,而 440MB 的体积使其能够进入对内存高度敏感的移动设备和边缘设备。腾讯同时公开了 2-bit 与 1.25-bit 两条技术路线,且后者已在 x86 平台上由 Intel 团队完成适配,这意味着超低比特量化不再局限于特定 ARM 架构,具备向 PC 和边缘服务器扩展的潜力。

从行业竞争角度看,翻译模型在同等体积下若能做到接近无损的 33 语言双向翻译,将对云端翻译 API 的商业模式构成一定替代压力。本地推理意味着更低的边际成本、更低的延迟和更强的隐私保护,这些都是云端服务难以同时满足的痛点。

对用户/开发者/创作者的影响

对普通用户而言,最直接的感知是 B 站直播场景中的实时翻译体验——弹幕翻译延迟控制在秒级以内,且无需将评论内容上传至服务器,隐私保护得到增强。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对开发者与端侧应用团队,这套方案提供了具体的技术参考:1.25-bit 量化不仅能压缩模型体积,还可在 CPU 上获得显著的 token 处理速度提升。若腾讯后续开放相关量化工具或预置模型,开发者在移动端、PC 端部署翻译、摘要等 NLP 任务时将多一个高性价比选项。对依赖云端翻译 API 的出海应用或实时交互产品团队,则需要关注本地化推理在成本和隐私维度上可能带来的方案切换空间。

值得关注的后续

目前公开信息显示,该技术已在 B 站直播弹幕场景验证了商业可行性。后续值得观察三个方向:其一,腾讯是否会将 1.25-bit 量化方案扩展到 Hy-MT2 之外的其他模型家族,形成一套通用的端侧压缩工具箱;其二,x86 适配完成后,是否会有更多 PC 端或边缘设备产品接入,尤其是需要多语言实时交互的会议、客服类场景;其三,压缩模型的推理速度与质量在不同硬件上的表现是否会公开更多基准数据,这决定了开发者能否据此评估迁移成本。

来源:AIbase

celebrityanime
celebrityanime
文章: 20637

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注