OpenAI 开放 GPT-Live-1 API:每分钟 0.05 美元,把 ChatGPT 同款语音能力交给开发者

OpenAI 把 ChatGPT 语音功能背后的实时语音模型 GPT-Live-1 开放为 API,前端语音处理每分钟 0.05 美元,开发者可以据此构建能边听边说的全双工语音助手。

一句话看懂:OpenAI 把 ChatGPT 语音功能背后的实时语音模型 GPT-Live-1 开放为 API,前端语音处理每分钟 0.05 美元,开发者可以据此构建能边听边说的全双工语音助手。

事件核心:发生了什么

OpenAI 宣布,目前用于 ChatGPT 语音功能的 GPT-Live-1 正式向开发者开放,可通过 API 集成到自有应用和业务流程中。该模型采用全双工架构,能在听用户说话的同时生成语音回复,从而更自然地处理打断、停顿、附和以及快速来回的对话。定价方面,前端语音处理为每分钟 0.05 美元,后端用于复杂推理的模型按对应模型价格单独计费。

与传统语音 AI 的“识别—推理—合成”三步链路不同,GPT-Live-1 不再等用户说完再处理。OpenAI 表示,这种架构明显降低了语音交互延迟;在测试中,GPT-Live-1 在 Full Duplex Bench 上比 GPT-Realtime-2.1 高出 30 个百分点,在轮次切换延迟和交互行为上提升明显,与 GPT-6 Astra 以中等推理强度搭配时,在评估端到端语音智能体任务的 Tau3 测试中排名第一。

为什么重要

语音一直是人机交互的重要入口,但过去的方案依赖多个独立模型拼接,开发者要自己处理切换和延迟问题,体验容易断裂。GPT-Live-1 把实时听说能力单独抽出来做成 API,等于把 ChatGPT 同款语音层的工程复杂度接管过来,后端推理则可按需组合——简单任务用更快更便宜的模型,复杂问题交给更强的推理模型。

对 OpenAI 而言,这是把语音能力产品化、按分钟计费的一步,语音 API 的商业模式进一步清晰。对行业来说,全双工语音智能体的门槛被拉低,餐厅预订、客服支持、语言学习等场景可能更快出现规模化应用。

对用户/开发者/创作者的影响

开发者可以不再自行协调多个模型,直接调用 GPT-Live-1 构建电话场景和全双工语音助手,并利用其原生语音识别转录、回复文本、关键词偏置和轮次检测等能力,该模型也针对嘈杂环境做了优化。OpenAI 还扩展了可用音色,覆盖更多口音、方言和语言。语言学习平台 Speak 的早期案例显示,相比此前的轮次式系统,GPT-Live-1 将系统主动打断学习者的次数减少了近 80%。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

创作者和企业需要留意成本结构:0.05 美元/分钟只覆盖前端语音处理,若任务涉及搜索、复杂分析或较长流程,后端推理费用另计。是否划算,取决于业务中复杂推理的占比。

值得关注的后续

一是实际接入后的延迟与打断体验是否稳定,尤其是中文和多方言场景;二是 0.05 美元/分钟的定价能否随规模下降,以及后端推理成本的组合是否可控;三是谷歌、Anthropic 等竞品是否跟进开放同类实时语音 API,以及开发者生态中会跑出哪些语音智能体产品。

来源:AIbase

celebrityanime
celebrityanime
文章: 22866

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注