一句话看懂:微软发布新一代语音转文字模型 MAI-Transcribe-2,在 60 语种测试中取得 5.2% 的平均词错误率,并打出每小时约 0.67 元人民币的限时低价,主打又快又准又便宜,直接对标 GPT-Transcribe 与 Gemini 系列。
事件核心:发生了什么
微软于 2026 年 9 月 4 日正式发布 MAI-Transcribe-2,定位为当前旗下最快、最准且成本最低的语音转文字(ASR)模型。价格方面,限时优惠为每小时 0.10 美元(约合人民币 0.67 元),该促销价格将持续至 2026 年底,目前开发者可通过 Microsoft Foundry、MAI Playground 及 OpenRouter 平台调用或测试。
性能数据是本次发布的核心看点。在 FLEURS 测试集中,MAI-Transcribe-2 在强制语言模式与自动语言检测模式下均取得 5.2% 的平均词错误率(WER)。作为参照,同一测试中 Gemini 3.1 Pro 的成绩为 5.3% 和 5.8%,GPT-Transcribe 为 10.4% 和 10.6%,Whisper v3-Large 则为 22.8% 和 23.5%。在推理速度方面,微软援引 Artificial Analysis 的评估称,MAI-Transcribe-2 比 GPT-Transcribe 快约 10 倍,比 Scribe v2 快 7 倍,比 Gemini 3.5 Transcribe 快 5 倍。
功能上,该模型新增说话人分离能力,可区分录音中的不同发言者并将文本归属到对应说话人;同时支持词级时间戳,方便音频搜索、剪辑与字幕对齐。此外提供逐字模式(保留语气词与口误,适用于合规分析)与清洁模式(移除语气词,生成更易读的字幕和笔记),并支持关键词偏置、自动语言识别、混合语言对话及嘈杂环境下的转录。模型覆盖 60 种语言,用户无需预先指定语种,系统可自动侦测。
为什么重要
MAI-Transcribe-2 的发布让语音转写赛道的竞争从“能用”进入“按毫秒和百分点计算”的阶段。词错误率从 Whisper 时代的 20% 以上压缩至 5% 左右,说明通用大模型在自动语音识别任务上的精度已接近专业人工转写水平,且这一成绩是在没有牺牲推理速度的前提下实现的。
更值得注意的是定价策略。每小时 0.10 美元的价格远低于主流商业 API 的常规报价,微软显然试图以“高精度+低成本”的组合锁定企业级批量转写需求,同时向 GPT-Transcribe 与 Gemini 系列施加价格压力。目前公开信息显示,这一限时价将持续到 2026 年底,是否形成长期价格锚点仍需观察。
从技术路线看,微软在语音识别中强调推理效率(比 GPT-Transcribe 快 10 倍),意味着模型架构或推理优化上有明显进展,这也会带动下游音视频处理、会议纪要、客服质检等应用的算力成本同步下降。
对用户/开发者/创作者的影响
对开发者而言,MAI-Transcribe-2 提供了更便宜、更精确的 ASR 选项,尤其是自动语言检测和混合语言支持能简化多语种 App 的开发流程,而词级时间戳与说话人分离直接降低了音视频索引和对话分析功能的实现门槛。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
对内容创作者与媒体从业者,清洁模式的转写输出可以直接用于字幕生成与排版,减少人工校对量;逐字模式则适用于访谈、法律记录等需要保留原始口语细节的场景。在 60 语种覆盖下,跨境电商、海外内容本地化团队可以以更低成本完成多语种素材的预处理。
对企业采购方,如果实际精度数据与官方测试一致,那么呼叫中心质检、会议转写、医疗或金融录音归档等高频场景的年度 API 费用将显著下降。不过,在迁移现有工作流之前,仍建议先在自有数据集上验证词错误率,因为 FLEURS 是通用测试集,未必能完全反映特定行业术语或方言口音的表现。
值得关注的后续
一是定价的可持续性:0.67 元人民币/小时的限时价结束后是否会回归常规价位,将直接影响企业用户的长期成本测算。二是竞品响应:谷歌与 OpenAI 是否会在下一版本中跟进降价或推出更强力的转录模型,目前尚无公开时间表。三是能力边界:60 语种的实际覆盖质量并不均衡,低资源语种在嘈杂环境下的表现、以及说话人分离对多人通话的处理上限,都需要更多真实场景测试来验证。
来源:AIbase


