一句话看懂:IBM 发布了两款 4.7 亿参数的开源语音识别模型 Granite Speech 5.0 Turbo CTC,可在 NVIDIA H200 上实现超过 12,600 RTFx 的推理速度,相当于每秒转录超过 3.5 小时的音频,同时将词错率(WER)控制在约 5%。
事件核心:发生了什么
8 月 25 日,IBM Granite 团队在 Hugging Face 博客发布了 Granite Speech 5.0 系列的两款新模型:granite-speech-5.0-470m-turboctc 和 granite-speech-5.0-470m-turboctc-nc。两者均为 470M 参数的纯编码器(encoder-only)语音识别模型,专攻英语短语音转写任务。
据官方公布的第三方测试数据,这两款模型在 OpenASR Leaderboard 公共测试集上的词错率分别为 5.00%(Apache 2.0 版)和 4.85%(CC-BY-NC-SA-4.0 版)。在推理速度上,二者的批量推理吞吐量均超过 12,600 RTFx——这是此前 Granite Speech 模型的 20 倍以上。此外,在远场语音识别 FFASR Leaderboard 上,两款模型分别位列准确率第五和第九,同时是该榜单上最快的两个模型。
与之前采用“声学编码器 + 投影器 + 大语言模型”架构的 Granite Speech 不同,这次的新模型去掉了语言模型部分,仅保留编码器结构。模型通过三层 2 倍下采样,将输入的 100 帧/秒对数梅尔频谱压缩为 12.5 tokens/秒的输出速率,并分别使用 SentencePiece 和 BPE 两种不同的词元化方案。两款模型的区别主要在于训练数据规模和许可证:-nc 版本使用额外数据训练,采用 CC-BY-NC-SA-4.0 非商业许可;Apache 2.0 版本则适合商用。
为什么重要
Granite Speech 5.0 Turbo CTC 的核心意义在于它验证了一条有别于“大模型万能”的技术路线:在语音转写这一具体任务上,去掉语言模型、采用纯 CTC 编码器架构,可以在大幅压缩模型体积和推理成本的同时,保持接近主流大模型的识别准确率。470M 参数在当前大模型动辄数十亿、上百亿参数的背景下属于轻量级,这使得它可以直接部署在边缘设备上,而不需要依赖云端 GPU 集群。
这一设计取舍也反映出语音识别市场正在加速分层:需要翻译、关键词偏置等复杂功能的任务继续使用 LM 增强模型;而追求极致吞吐和低延迟的纯转写场景,则可以用更小的专用模型来承接。Apache 2.0 许可证的提供,也意味着企业可以在商业产品中直接集成该模型,无需承担开源协议带来的合规风险。
对用户/开发者/创作者的影响
对开发者而言,这两款模型最直接的价值在于降低了语音转写功能的集成门槛。Apache 2.0 版本允许自由商用,且模型体积小、推理速度快,适合部署在手机、嵌入式设备或实时字幕服务中。Hugging Face 上还提供了基于 WebGPU 的流式识别演示(目前仅支持 Chrome 或 Edge 浏览器),方便开发者快速评估识别效果和响应速度。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
对于需要批量处理音频内容的企业用户——例如会议记录、客服质检、播客字幕生成等场景——超过 12,600 RTFx 的吞吐量意味着处理成本可以显著下降。不过需要注意,新模型牺牲了此前 Granite Speech 模型具备的语音翻译和关键词偏置能力,如果业务依赖这些功能,仍需选择 LM 增强版模型。
值得关注的后续
目前公开信息显示,这两款模型已经可以在 Hugging Face 上下载使用。后续值得关注的有三点:一是 OpenASR 官方榜单结果是否与 IBM 发布的非官方数据一致,这将决定社区对其准确率结论的信任程度;二是 Apache 2.0 版本在真实商用环境中的性能反馈,尤其是在长音频和噪声场景下的表现;三是在 IBM 的示范效应下,其他厂商是否会跟进推出类似的小参数、高吞吐 CTC 语音模型,从而进一步压低边缘端语音识别的成本门槛。


