OpenAI 推出两款新转录模型 API

OpenAI 在 2026 年 7 月 28 日通过 API 推出两款新转录模型——GPT-Live-Transcribe(低延迟实时转录)和 GPT-Transcribe(异步批量转录),在口音、专业术语、嘈杂环境等真实场景下显著提升了准确率。这意味着开发者无需自建复杂语音管线,即可获得高精度、低延迟的语音…

一句话看懂:OpenAI 在 2026 年 7 月 28 日通过 API 推出两款新转录模型——GPT-Live-Transcribe(低延迟实时转录)和 GPT-Transcribe(异步批量转录),在口音、专业术语、嘈杂环境等真实场景下显著提升了准确率。这意味着开发者无需自建复杂语音管线,即可获得高精度、低延迟的语音转文字能力。

事件核心:发生了什么

OpenAI Developers 官方账号宣布,API 新增两款转录模型:GPT-Live-Transcribe 专为实时流式音频设计,优化了低延迟场景;GPT-Transcribe 面向完整的音频文件和批量任务,采用异步处理方式。两款模型都在上下文理解上做了针对性改进,能够更准确地识别短句、数字、专业术语以及带有强背景噪音的语音,同时覆盖多口音和多语言。目前公开信息显示,这两款模型是对 OpenAI 已有 Whisper 系列能力的补充和升级,直接通过 API 调用,无需额外部署。

为什么重要

语音转录是 AI 应用中最成熟也最刚需的赛道之一,但长久以来开发者必须在“高精度”和“低延迟”之间做取舍。OpenAI 这次把两个场景拆开优化,意味着 API 用户可以根据需求选择最优方案,无需再自行平衡。对 OpenAI 自身而言,这扩大了其 API 的产品矩阵,增强了与 Deepgram、AssemblyAI 等专业转录服务商的竞争力。更重要的是,模型在嘈杂环境、专业术语和短句上的改进,直接瞄准了会议记录、客服质检、医疗听写等高频应用场景的痛点,有助于推动语音 AI 从“能用”走向“好用”。

对用户/开发者/创作者的影响

开发者:可以直接在 OpenAI API 中调用实时转录模型,构建语音助手、实时字幕、音频搜索等功能,无需搭建自有的 WebSocket 或 ASR 管道;异步模型则适合处理大量录音文件,成本可控且准确率有保障。内容创作者(播客、视频制作者、记者):可用异步模型自动生成高精度字幕或文字稿,减少人工校对时间,尤其适用于多人对话、口音混杂或环境嘈杂的录制内容。企业用户(客服中心、在线教育、医疗录音):实时转录可用于生成通话摘要或实时辅助对话,异步模型可用于批量处理历史录音,配合 OpenAI 的后续分析模型(如 GPT-4o)可以快速产出结构化报告。目前公开信息未披露具体定价和可用区域,但预计会延续 OpenAI API 的按量计费模式。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

第一,OpenAI 是否会为这两款模型提供多语言细分的性能基准,以及是否开放评测数据集,这将直接影响开发者的选型决策。第二,定价策略——实时转录通常比异步更贵,OpenAI 的价格是否会比专业转录服务更有吸引力,是需要观察的关键变量。第三,竞品反应:Deepgram 已提供 Nova-2 等低延迟模型,AssemblyAI 也有实时和异步方案,OpenAI 入局可能促使整个行业加速降价或增加功能。最后,模型是否会开源或提供本地部署选项尚未可知,对于数据敏感的企业来说,这不一定是首选方案。

来源:X:OpenAI Developers (@OpenAIDevs)

celebrityanime
celebrityanime
文章: 15658

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注