一句话看懂:OpenAI 在 7 月 29 日推出两款转录模型 GPT-Live-Transcribe 和 GPT-Transcribe,主打上下文理解能力,在多项测试中将转录错误率降至 Whisper 的一半以下,且价格更具竞争力。
事件核心:发生了什么
OpenAI 于 2026 年 7 月 29 日发布两款新型转录模型,开放 API 调用。其中,GPT-Live-Transcribe 专为低延迟实时场景设计,每分钟调用成本约 0.017 美元(约合 0.12 元人民币);GPT-Transcribe 面向已完成音频文件和批量处理任务,采用异步转录方式,每分钟成本仅 0.0045 美元(约合 0.03 元人民币)。两款模型的核心突破在于对语境的理解能力:在 Context Aware ASR 基准测试中,GPT-Transcribe 在加入上下文提示后,语义准确率从 41.6% 提升至 45.2%。相比上一代 Whisper(whisper-1),新模型优势明显:在 Common Voice 涵盖的 22 种语言测试中,GPT-Transcribe 转录错误率降至 19.27%,而 Whisper 为 40.37%;在 9 种语言的真实录音测试中,前者错误率仅为 8.98%,后者则达 15.21%。
为什么重要
这一更新直接拉高了语音转录行业的准确率天花板。此前,Whisper 作为 OpenAI 的开源模型,是诸多开发者和企业级应用的默认选项。新模型不仅错误率降低超过一倍,更重要的是具备了区分口音、专业术语、数字及背景噪声的“上下文理解”能力,解决了过去“听清但听不懂”的痛点。从商业化角度看,实时转录模型(GPT-Live-Transcribe)的定价仅为每分钟 0.12 元人民币,批量模型更低至 0.03 元人民币,大幅降低了企业采用高质量语音 AI 的门槛,将倒逼其他 ASR 服务商调整定价或提升性能。
对用户/开发者/创作者的影响
对 开发者 而言,API 接口直接可用,无需自建模型训练或微调,即可获得远超 Whisper 的转录质量,尤其适用于医疗、法律、金融等对术语识别要求高的垂直场景。创作者和内容生产者 可以利用批量模型,将播客、采访、线下讲座的音频文件低成本转为高质量文字稿,后期编辑效率显著提升。普通用户 更直接的体验在于,未来搭载这些模型的产品——如会议记录工具、实时字幕应用、语音助手——将更好地处理嘈杂环境或带口音的指令,交互准确性和流畅度很可能上一个台阶。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
第一,新模型是否会替代 Whisper 成为 OpenAI 语音生态的核心基础,以及 Whisper 的后续更新路线是否调整。第二,价格是否随着 API 使用量上升而进一步下降,目前已知的定价已在多数场景低于市面上同类服务。第三,亚马逊、谷歌等主要云服务商,以及基于 Whisper 构建的第三方转录工具,是否会快速跟进推出类似能力的竞品模型或降价策略。第四,在安全与合规层面,实时转录涉及的数据隐私问题,可能成为企业采纳该服务时需要评估的潜在风险。
来源:AIbase


