一句话看懂:Hugging Face 在 2026 年 9 月 30 日发布 Open TTS Leaderboard,用客观指标评估多语言文本转语音与语音克隆模型,把单个模型的评测周期从数周缩短到数小时,试图补上开源 TTS 评测长期碎片化的短板。
事件核心:发生了什么
截至 2026 年 9 月 30 日,Hugging Face Hub 上已有超过 8000 个 TTS 模型,但评测方式仍不统一。现有的 TTS Arena v2、Artificial Analysis、Voice Arena 等竞技场排行榜依靠用户盲听投票并计算 Elo 分,获取结果往往需要数周。新上线的 Open TTS Leaderboard 改用三类客观指标:用 Qwen3 ASR 计算词错误率(WER)和字错误率(CER)衡量可懂度;用 H200 GPU 上的批处理逆实时因子(RTFx)和首音频延迟(TTFA)衡量速度;用 WavLM 说话人嵌入的余弦相似度(SIM)衡量语音克隆的相似度。默认榜单按 Seed TTS Eval 和 CV3 Eval 英文切片的宏平均 WER 排名,Kokoro-82M、supertonic-3、s2-pro 靠前;多语言场景下 OmniVoice、s2-pro、Fun-CosyVoice3-0.5B-2512 表现较强。
为什么重要
竞技场式评测依赖真人投票,模型接入慢、投票者标准不稳定,导致开源权重模型在榜上长期偏少——Artificial Analysis 的 92 个模型中只有 16 个是开放权重。客观指标虽然不能替代人类偏好,但能低成本、可复现地覆盖可懂度、速度和声音相似度三个互补维度,让新模型发布后几小时就能进入横向对比。这对开源 TTS 生态尤其关键:闭源厂商有动力主动送测,开源作者往往没有,新榜单降低了开源模型被看见的门槛。
对用户/开发者/创作者的影响
开发者选型时可以直接比对 WER、RTFx 和 SIM,快速判断某个模型更适合实时语音助手、批量配音还是语音克隆。创作者可以用声线相似度数据筛选克隆质量更稳的模型。需要留意的是,榜单不衡量自然度、表现力和听感偏好,且速度数据来自 H200 和 CPU 的特定配置,实际部署环境不同,结论可能偏移。目前公开信息显示,该榜单仍在完善,尚未覆盖所有语言和模型。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
一是社区反馈能否推动补充自然度、情感表达等主观维度,或与竞技场投票结果交叉验证;二是多语言覆盖是否会从目前的英文、中文扩展到更多语种;三是能否吸引更多开源模型作者主动提交权重和推理配置,让榜单真正反映开源 TTS 的实际水平。


