无需显卡,也无需大内存Mac,HuggingFace 上开源的 ASR 和 TTS模型直接能跑!我花了一周时间,把 HuggingFace 上真正值得关注的语音模型全部理了一遍: 先搞清楚一件事 ASR(听):大模型架构(Encoder-LLM)负责多语种与高精度语义纠错,但端侧声学小模型在 CPU 上同样能打 TTS(说):目前早就是小模型的天下,几十 MB 的 ONNX 模型在普通 CPU 上就能跑出播放速度 4 倍以上的生成速度…

独立开发者 WquGuru 实测了 HuggingFace 上当前主流的开源 ASR 与 TTS 模型,结论是语音合成(TTS)已进入几十 MB 小模型的 CPU 可跑时代,而语音识别(ASR)则呈现“多语种大模型保精度、端侧小模型拼速度”的并行路线。








