Open TTS Leaderboard:面向多语言文本转语音和语音克隆的可扩展评测

Hugging Face 在 2026 年 9 月 30 日发布 Open TTS Leaderboard,用客观指标评估多语言文本转语音与语音克隆模型,把单个模型的评测周期从数周缩短到数小时,试图补上开源 TTS 评测长期碎片化的短板。

一句话看懂:Hugging Face 在 2026 年 9 月 30 日发布 Open TTS Leaderboard,用客观指标评估多语言文本转语音与语音克隆模型,把单个模型的评测周期从数周缩短到数小时,试图补上开源 TTS 评测长期碎片化的短板。

事件核心:发生了什么

截至 2026 年 9 月 30 日,Hugging Face Hub 上已有超过 8000 个 TTS 模型,但评测方式仍不统一。现有的 TTS Arena v2、Artificial Analysis、Voice Arena 等竞技场排行榜依靠用户盲听投票并计算 Elo 分,获取结果往往需要数周。新上线的 Open TTS Leaderboard 改用三类客观指标:用 Qwen3 ASR 计算词错误率(WER)和字错误率(CER)衡量可懂度;用 H200 GPU 上的批处理逆实时因子(RTFx)和首音频延迟(TTFA)衡量速度;用 WavLM 说话人嵌入的余弦相似度(SIM)衡量语音克隆的相似度。默认榜单按 Seed TTS Eval 和 CV3 Eval 英文切片的宏平均 WER 排名,Kokoro-82M、supertonic-3、s2-pro 靠前;多语言场景下 OmniVoice、s2-pro、Fun-CosyVoice3-0.5B-2512 表现较强。

为什么重要

竞技场式评测依赖真人投票,模型接入慢、投票者标准不稳定,导致开源权重模型在榜上长期偏少——Artificial Analysis 的 92 个模型中只有 16 个是开放权重。客观指标虽然不能替代人类偏好,但能低成本、可复现地覆盖可懂度、速度和声音相似度三个互补维度,让新模型发布后几小时就能进入横向对比。这对开源 TTS 生态尤其关键:闭源厂商有动力主动送测,开源作者往往没有,新榜单降低了开源模型被看见的门槛。

对用户/开发者/创作者的影响

开发者选型时可以直接比对 WER、RTFx 和 SIM,快速判断某个模型更适合实时语音助手、批量配音还是语音克隆。创作者可以用声线相似度数据筛选克隆质量更稳的模型。需要留意的是,榜单不衡量自然度、表现力和听感偏好,且速度数据来自 H200 和 CPU 的特定配置,实际部署环境不同,结论可能偏移。目前公开信息显示,该榜单仍在完善,尚未覆盖所有语言和模型。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是社区反馈能否推动补充自然度、情感表达等主观维度,或与竞技场投票结果交叉验证;二是多语言覆盖是否会从目前的英文、中文扩展到更多语种;三是能否吸引更多开源模型作者主动提交权重和推理配置,让榜单真正反映开源 TTS 的实际水平。

来源:Hugging Face Blog

celebrityanime
celebrityanime
文章: 26517

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注