Meta 首个实时音频感知模型来了:20 多人同时说话也能分轨转写,每千分钟 3 美元

Meta 发布首个实时音频感知模型 Muse Voice Transcribe,支持 20 人以上同时说话的分轨转写,并通过 Meta Model API 开放调用。每 1000 分钟音频定价 3 美元(约 20.2 元人民币),相当于每小时 0.18 美元。

一句话看懂:Meta 发布首个实时音频感知模型 Muse Voice Transcribe,支持 20 人以上同时说话的分轨转写,并通过 Meta Model API 开放调用。每 1000 分钟音频定价 3 美元(约 20.2 元人民币),相当于每小时 0.18 美元。

事件核心:发生了什么

Meta 于 2026 年 9 月 1 日前后推出 Muse Voice Transcribe,这是其首个实时音频感知模型。与常见的“先录音后转写”流程不同,该模型将流式自动语音识别、说话人分离和端点检测整合在同一过程中——用户说话时系统即时输出文本片段,无需等待整段音频结束。官方信息显示,该模型能识别超过 20 个不同说话人的声音,并在对方停止讲话时自动判断输入边界,适用于实时字幕、会议纪要和通话转写等场景。

语言支持方面,Muse Voice Transcribe 覆盖 70 多种语言,其中有 25 种语言在发布时经过验证;支持超过一小时的音频输入,并允许在句内或句间自然切换语言。开发者还可以通过语言、关键词和上下文偏置参数,针对特定术语或行业场景提升识别准确率。根据 Meta 公布的数据,截至 2026 年 9 月 1 日,该模型在 Artificial Analysis 的流式语音转文字排行榜上位列第一。

为什么重要

Muse Voice Transcribe 首次把“实时转写”与“高密度说话人分离”放进同一个模型,而不是像以往那样依赖多套系统串联,这直接降低了实时音频处理的技术门槛。对开发者而言,Meta Model API 的开通意味着不需要自己部署复杂的音频管线,即可获得流式识别能力,而“每千分钟 3 美元”的定价明显低于现阶段市场常见实时转写服务的报价水平。

从行业竞争角度看,Meta 选择以接近成本价的策略切入实时语音 API 市场,对标的是云服务商和独立语音 AI 公司。其“自适应延迟”机制也值得留意:系统不会对所有词汇采用固定的速度与精度取舍,而是根据识别难度动态决定输出时机——对清晰的语音更快出结果,对含技术术语或噪声较多的语音则多利用上下文窗口,这种设计在准确率和体验之间提供了新的平衡方案。

对用户/开发者/创作者的影响

对开发者来说,最直接的变化是可以通过 Meta Model API 快速接入实时转写能力,特别是在电话会议、直播字幕、客服录音分析等对延迟敏感的场景。20 人以上的说话人分离能力,也意味着它可能适用于远程庭审记录、多人访谈整理等过去较难自动化的场景。但需要留意的是,目前仅 25 种语言经过发布验证,中文等语种的准确率尚需实际测试。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对于内容创作者和媒体从业者,该模型的实用价值在于能缩短从“说话”到“成稿”的路径:采访中多人同时发言时,系统能按说话人分开输出文本,后期整理效率会有明显提升。对普通用户而言,如果该能力后续集成到 Meta 的会议或通讯产品中,实时字幕和自动纪要将成为常见功能。不过,实时音频处理涉及隐私与合规问题,尤其是会议录音的多方授权,企业和开发者在接入前需要评估所在地的法规要求。

值得关注的后续

目前公开信息显示,Muse Voice Transcribe 仅开放 API 调用,尚不清楚是否会在 Meta 自有产品(如 WhatsApp、Workplace)中默认启用。建议关注以下几点:一是该模型是采用开源还是闭源路线,这会影响它能否被集成到第三方本地化部署中;二是3 美元/千分钟的定价是否具有持续性,竞品是否会跟进调整实时转写价格;三是中文、日语等非欧美语种的实测准确率,以及后续是否有按垂直行业调优的版本推出。此外,还需观察该能力是否会被并入更完整的“音频理解”模型,而不仅仅是语音转文字工具。

来源:AIbase

celebrityanime
celebrityanime
文章: 21411

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注