一句话看懂:Meta 旗下 Superintelligence Labs 发布了首个实时音频感知模型 Muse Voice Transcribe,能在对话进行中同步完成语音转写、说话人区分和句子边界识别。该模型以每小时 0.18 美元的低价入市,被视为 Meta 推动“永不间断聆听”的个人 AI 助手底层技术。
事件核心:发生了什么
Meta 于 9 月发布 Muse Voice Transcribe,这是其 Superintelligence Labs 重组后推出的首款实时音频模型。该模型将输入音频切分为 80 毫秒的片段,逐词判断是否需要继续聆听再输出转写文本,从而动态平衡速度与准确率——简单词汇响应更快,困难词汇会获得更多聆听时间,这一策略通过强化学习训练实现。
除转写外,模型在同一架构内完成说话人标记(支持最多 20 个说话人区分)和句子边界识别,无需额外系统。训练覆盖超过 70 种语言,其中 25 种经过深度测试,并支持句中跨语言切换。独立测评机构 Artificial Analysis 数据显示,在说话人结束发言后 0.16 秒内,该模型英文转写词错误率为 3.1%,优于 ElevenLabs Scribe v2 Realtime 的 3.6% 和 AssemblyAI Universal-3.5 Pro Realtime 的 4.0%。定价方面,Muse Voice Transcribe 为每小时 0.18 美元(即每千分钟 3 美元),显著低于 Cartesia Ink-2 的 4 美元和 ElevenLabs、Deepgram Flux 的 6.5 美元。
为什么重要
这是 Meta 首次将转写、说话人分离与句子边界检测合并进单一实时模型,而非拼接多个子系统,这降低了实时语音助手的延迟与架构复杂度。更重要的是,Meta 延续了 Muse Spark 系列“以价格竞争而非峰值性能”的策略,用低于主要竞品一半以上的价格切入实时语音转写市场,直接对标 OpenAI 于今年 5 月发布的 GPT-Realtime-Whisper 及 7 月的降价动作。Meta 未公开参数量、训练数据规模与权重,属于闭源发布,但在实时语音感知这一关键入口上,Meta 正试图用成本优势抢占开发者默认选项的位置。
对用户/开发者/创作者的影响
对开发者而言,Muse Voice Transcribe 已通过 Meta Model API 开放,支持超过 70 种语言和长于一小时的录音处理,无需额外后处理即可获得带说话人标签和句子边界的转写结果,适合用于会议记录、客服质检、播客转录等场景。其每小时 0.18 美元的价格大幅降低了实时语音功能的生产成本。对 Meta AI 用户来说,该模型已驱动语音听写功能,用户可在任意应用中按住 Fn 键调用。结合 Meta 展示的 AI 眼镜场景,该模型为“随时在场的语音助手”提供了技术基础,但这也意味着更持续的音频采集与处理,可能引发隐私与合规层面的讨论——此前德国联邦网络局曾讨论但最终未对 Meta 带摄像头眼镜发布禁令。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
第一,实时语音转写市场的价格战是否进一步加剧,OpenAI、ElevenLabs 等是否会跟进降价。第二,Meta 是否将该模型扩展至更长的多说话人实时场景(如会议、访谈),并开放更多语言深度优化。第三,在监管层面,持续聆听型 AI 助手若与智能眼镜等硬件结合,欧洲及美国部分州对录音同意的法律限制可能影响其实际部署节奏。目前公开信息显示,Meta 尚未披露该模型的参数规模与训练数据来源,也未计划开放权重。


