微软发布MAI-Transcribe-2语音识别模型,每小时仅0.10美元

微软于9月3日发布新一代语音识别模型MAI-Transcribe-2,在60种语言的FLEURS基准测试中平均词错率低至5.2%,处理一小时音频仅需约10秒,限时价格低至每小时0.10美元,试图在准确率、速度和成本上同时拉开差距。

一句话看懂:微软于9月3日发布新一代语音识别模型MAI-Transcribe-2,在60种语言的FLEURS基准测试中平均词错率低至5.2%,处理一小时音频仅需约10秒,限时价格低至每小时0.10美元,试图在准确率、速度和成本上同时拉开差距。

事件核心:发生了什么

微软在9月3日正式推出语音识别模型MAI-Transcribe-2,定位为迄今最强且最高效的转写产品。根据公开数据,该模型在覆盖60种语言的FLEURS基准测试中取得5.2%的平均词错率(WER),并在Artificial Analysis词错率排名中位列第二。除准确率外,其长音频处理速度最高可达竞品的10倍,处理一小时音频仅需约10秒。目前该模型已上线Microsoft Foundry、MAI Playground和Open Router平台,并提供限时优惠价——每小时音频转写仅需0.10美元,远低于同类商用API常见定价区间。

为什么重要

MAI-Transcribe-2的发布并不只是一次常规模型迭代,而是一次面向成本与性能边界的重新定义。当前AI应用正从单模态交互走向多模态与实时语音智能,而高吞吐、低延迟和低成本的语音基础设施正成为关键竞争壁垒。微软用0.10美元/小时的价格直接冲击现有语音转写市场的定价体系,同时以10倍速度优势为实时场景提供可能。这意味着语音转写的部署门槛被显著拉低,尤其是面向多语言音频的大规模处理,过去受限于成本或算力的应用场景将获得新的落地空间。该模型还集成了说话人分离、词级时间戳、关键词偏好与自动语种检测能力,能处理Hinglish与Spanglish等语码混合场景,并支持在“逐字转写”和“简洁转写”两种风格间切换,使其更贴近法律、临床、字幕及高合规分析等真实复杂场景的需求。这一套功能组合表明微软在刻意拉高行业对“可用语音模型”的标准,而不只是追求单一指标领先。

对用户/开发者/创作者的影响

对开发者而言,最直接的变化来自成本结构:按每小时0.10美元计算,处理100小时音频的开销约为10美元,这使大规模转写不再是少数企业的专属能力,中小团队也可以将高质量多语言语音分析嵌入自身产品。更值得关注的是处理速度——约10秒完成一小时音频转写意味着开发者可以构建更接近实时反馈的工作流,例如会议摘要、客服质检或直播字幕生成。创作者则可利用其语码混合识别和噪音抵抗能力来处理多语言访谈、现场录音等素材,减少人工校对时间。对需要高合规性的行业用户来说,词级时间戳与说话人分离功能降低了法律、医疗等场景中的追溯成本。不过需注意,微软提供的是限时优惠价,后续是否维持这一价位尚无明确信息,企业若计划批量接入,应对未来定价调整有所预留。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

目前公开信息显示,MAI-Transcribe-2已对开发者开放,但有三点值得持续追踪:其一,该模型是否会在Azure OpenAI服务中集成,这将直接决定其触达范围能否从开发者群体扩展至更广泛的企业客户;其二,0.10美元/小时的促销价格结束后是否回调,以及微软会否推出阶梯式定价或针对长音频场景的打包方案;其三,竞品是否会跟进这一价格与速度组合——若其他厂商被迫调价或优化推理架构,将加速整个语音转写市场从按量计费转向更复杂的算力效率竞争。此外,该模型支持自动语种检测与语码混合场景,其官方文档中关于多语言实时交互的示例是否能催生新的端到端语音应用生态,也值得开发者保持观察。

来源:AIbase

celebrityanime
celebrityanime
文章: 22342

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注