告别卡顿与机械感:OpenAI 推出全双工语音模型 GPT-Live-1

OpenAI 在 API 中上线了全双工语音模型 GPT-Live-1,用单一模型同时处理音频输入与输出,替代传统的“语音转文字—模型推理—文字转语音”级联架构,定价为前端语音层每分钟 0.05 美元。

一句话看懂:OpenAI 在 API 中上线了全双工语音模型 GPT-Live-1,用单一模型同时处理音频输入与输出,替代传统的“语音转文字—模型推理—文字转语音”级联架构,定价为前端语音层每分钟 0.05 美元。

事件核心:发生了什么

根据 AIbase 报道,OpenAI 于 2026 年 9 月推出 GPT-Live-1,并已在 API 中全面开放。与以往语音智能体不同,该模型不再把输入和输出拆成多个环节,而是由单一模型统一处理双向音频流,因此支持即时打断,也能在对话继续进行的同时,把深度推理和工具调用交给后台文本模型处理。

公开信息中的几个可核查数据:语言学习平台 Speak 的早期测试显示,用户在思考停顿时的被打断率下降了近 80%;Yelp、Intercom 等合作方表示轮次切换(turn switching)的准确率有明显提升;在基准测试中,GPT-Live-1 与推理强度适中的 GPT-6 Astra 搭配时表现突出。

为什么重要

语音交互长期受制于级联架构的固有延迟:语音识别、模型推理、语音合成依次执行,任何一环都会累积等待时间,遇到停顿、抢话或话题切换时尤其容易“卡壳”。GPT-Live-1 把这条链路压缩成一个模型,等于从架构层面削弱了延迟来源,而不是靠工程调优去掩盖。

这也意味着语音层的竞争焦点正在转移。过去比拼的是识别准确率和音色自然度,现在更看重轮次切换、打断处理、背景噪声下的稳定性,以及语音层与后端推理、工具调用之间的分工。OpenAI 选择把语音前端单独定价、把重推理留在文本模型侧,是一种把成本与能力解耦的产品思路。

对用户/开发者/创作者的影响

对开发者而言,接入门槛主要在 API 层:可按分钟计费,0.05 美元每分钟的前端语音成本适合先做小规模验证,再评估长对话场景下的总开销。系统提示词可用来定制语气、节奏和对话风格,这意味着电话客服、餐厅预订、长时段陪伴式对话等场景可以直接复用同一套模型能力。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对企业和创作者来说,实际收益体现在“少打断、少重复”上。背景噪声和静默上下文的处理能力,决定了 AI 语音支持能否真正脱离一问一答的机械节奏。目前公开信息显示,该模型更适合交互密集、需要频繁切换话题的语音业务,而非单纯的语音转写任务。

值得关注的后续

一是定价与配额是否调整。0.05 美元每分钟对高频长对话业务并不便宜,若调用量放大,成本结构可能影响企业采购决策。二是竞品是否跟进全双工路线。Google、Anthropic 以及国内语音厂商是否会推出同类单模型架构,将决定这条技术路线是成为标配还是阶段性方案。三是开发者生态的落地案例,尤其是 Speak、Yelp、Intercom 之外,能否出现可公开验证的规模化语音智能体产品。

来源:AIbase

celebrityanime
celebrityanime
文章: 22860

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注