GPT Transcribe 较前代有所提升,但在错误率上仍不及 ElevenLabs、Google 和 Mistral。

OpenAI 推出新一代转录 API 模型 GPT Transcribe 和 GPT Live Transcribe,错误率较前代降低 0.7 个百分点,但在当前开源与闭源模型的竞争中,其准确率仍落后于 ElevenLabs、Google 和 Mistral 的头部产品,同时价格已被对手拉低。

一句话看懂:OpenAI 推出新一代转录 API 模型 GPT Transcribe 和 GPT Live Transcribe,错误率较前代降低 0.7 个百分点,但在当前开源与闭源模型的竞争中,其准确率仍落后于 ElevenLabs、Google 和 Mistral 的头部产品,同时价格已被对手拉低。

事件核心:发生了什么

2026 年 7 月 29 日,OpenAI 通过 API 发布了两款新的语音识别模型:GPT Transcribe(处理预录音频,速度约为实时 34 倍)和 GPT Live Transcribe(面向低延迟实时流)。根据第三方基准测试 AA-WER,GPT Transcribe 的词错误率(WER)为 3.31%,比一年前的 GPT-4o Transcribe 改善约 0.7 个百分点。定价方面,OpenAI 降价 25% 至每分钟音频 0.0045 美元。新模型支持文本上下文、关键词及多语言输入。

然而,在 AA-WER 排行榜上,OpenAI 仍落后于主要竞品:ElevenLabs Scribe v2 以 2.3% 领先,Google Gemini 3 Pro 为 2.9%,Mistral Voxtral Small 为 3.0%。值得注意的是,Mistral 前不久推出的 Voxtral Transcribe V2 已将价格压至每分钟 0.003 美元。

为什么重要

这轮更新揭示了语音转录赛道进入“平权”阶段:准确率提升趋于平稳(每代改进不到 1 个百分点),竞争焦点正从单纯拼精度转向定价、延迟和开发者生态。OpenAI 凭借品牌和 API 整合能力仍占据有利位置,但 ElevenLabs 与 Mistral 以更低的错误率和更激进的价格策略,正在侵蚀其市场份额。同时,Google 的 Gemini 3 Pro 表现也证明端到端多模态模型的转录能力已不输专用模型。这意味着企业用户在采购转录服务时有了更多性价比选择,不再局限于 OpenAI 一家。

对用户/开发者/创作者的影响

对开发者:GPT Transcribe 的 34 倍加速和实时模型降低了集成门槛,但需评估准确率是否满足业务场景(如医疗、法律等对误差敏感的场景)。如果追求最低错误率,ElevenLabs 或 Mistral 可能更优;若需要与 OpenAI 的其他 API(如 GPT-4o、Realtime)深度集成,则继续使用 OpenAI 更便捷。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对创作者:字幕生成、会议纪要、播客转写等场景的成本进一步下降。按每分钟 0.0045 美元计算,处理一小时音频仅需 0.27 美元,相比一年前节省约 25%。但需注意,若接受 3.31% 的错误率,后期校对时间可能抵消降价收益。

对微调/训练团队:OpenAI 同时发布了 GPT-Realtime-Whisper 实时转录模型,与新的 Realtime 模型生成功能配合,为语音交互式 AI(如语音助手、客服)提供了统一接口,值得测试。

值得关注的后续

1. 价格战是否会继续:Mistral 已拉低至 $0.003/分钟,OpenAI 是否会进一步降价或推出更低成本的轻量版?

2. ElevenLabs 的护城河:其 Scribe v2 错误率领先约 1 个百分点,能否在更多语种和噪声环境下保持优势?

3. 多模态融合趋势:Google 的 Gemini 3 Pro 作为多模态模型取得较好转录成绩,未来专用转录模型是否会逐渐被通用多模态模型取代?OpenAI 的 GPT-5 或后续版本若整合更强语音能力,可能改变格局。

来源:The Decoder AI News

celebrityanime
celebrityanime
文章: 15821

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注