小米开源工业级目标说话人语音识别大模型 CocktailASR-1

小米开源了工业级目标说话人语音识别大模型 CocktailASR-1,只需一段参考音频,就能从多人混说的音频中只转写指定对象的话,并在多个混音测试集上把词错误率压到远低于同类方案的水平。

一句话看懂:小米开源了工业级目标说话人语音识别大模型 CocktailASR-1,只需一段参考音频,就能从多人混说的音频中只转写指定对象的话,并在多个混音测试集上把词错误率压到远低于同类方案的水平。

事件核心:发生了什么

小米近期正式开源 CocktailASR-1,相关代码已按 Apache 2.0 协议发布在 GitHub,权重可从 HuggingFace 加载,依赖仅需 torch、torchaudio、transformers、soundfile 等基础库。该模型改写了语音识别的输入方式:用户提供一段目标说话人的参考音频加目标单声道音频,中间用一秒静音分隔,模型通过声纹嵌入定位目标说话人,只转写这个人的语音,同时过滤他人说话、混响和背景噪声。

架构上它采用端到端大模型方案,由 D2V2 音频编码器、Adapter 和大模型解码器串联,全部权重集成在单个 checkpoint 中。公开的基准数据显示:LibriMix2mix 和 LibriSpeechMix2mix 上词错误率分别为 4.11% 和 2.90%;在 LibriMix3mix 中,部分同类模型词错误率高达 76% 至 121%,而 CocktailASR-1 仅为 12.29%。在 AMI SDM、AliMeeting Far 等真实会议录音场景,以及 LibriSpeech、WenetSpeech、CommonVoice-zh 等单人数据集上,它也取得领先表现。

为什么重要

“鸡尾酒会问题”是语音领域长期未解的难题,传统 ASR 的默认逻辑是把所有声音都转写下来,多人同时说话时几乎不可用。CocktailASR-1 把任务从“全量转写”改成“锁定一个人”,这属于任务定义层面的变化,而不是单纯把模型做大。对行业而言,这意味着语音识别在会议记录、车载语音、智能音箱等真实复杂场景中的可用性可能明显提升,同时它选择开源而非闭源,会直接压低同类目标说话人方案的技术门槛。

对用户/开发者/创作者的影响

开发者可以较低成本把目标说话人识别接入现有产品,部署环境要求不高,适合做会议纪要、访谈整理、字幕生成等应用。模型还具备负样本拒识能力:当参考音频对应的人并未参与当前对话时,直接输出空文本,可减少智能音箱、车载助手被旁人声音误触发的概率。此外它支持链式推理,可用特定标签展示识别说话人的过程,对调试和可解释性有帮助,对准确率影响有限。创作者做多人播客或采访剪辑时,多了一个可自部署的分离转写选项;企业采购则需自行评估合规与数据留存问题。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是实际产品落地情况,小米是否将其用于自家音箱、汽车或办公产品;二是社区微调与多语种扩展能否跟上,目前公开信息显示中文和英文数据集表现较好;三是同类闭源与开源方案的跟进速度,尤其是真实远场、强混响场景下的稳定性验证。

来源:AIbase

celebrityanime
celebrityanime
文章: 22886

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注