OpenAI正式上线GPT-Live-1 API:支持打断处理、工具调用与电话智能体

OpenAI 把新模型 GPT-Live-1 正式接入 API,让开发者可以构建支持打断、停顿和背景噪声的全双工实时语音应用,语音交互从"分段处理"走向同模型内的端到端对话。

一句话看懂:OpenAI 把新模型 GPT-Live-1 正式接入 API,让开发者可以构建支持打断、停顿和背景噪声的全双工实时语音应用,语音交互从”分段处理”走向同模型内的端到端对话。

事件核心:发生了什么

据 AIbase 报道,OpenAI 近期宣布在 API 中上线 GPT-Live-1。该模型把语音理解与语音输出整合进同一个模型,取代了传统”语音转文字—大模型推理—文字转语音”的多段拼接链路,从而降低系统延迟。官方称其支持全双工对话,可在输出语音的同时持续听用户说话,并处理打断、停顿、背景噪声等真实场景。开发者可通过系统提示调整语气、语速和对话风格,配置后端模型、工具和智能体框架,并接入 Codex 等工具。配合 OpenAI Presence,还能查询企业系统、执行授权操作,必要时转接人工客服。

为什么重要

语音一直是人机交互中最自然、也最难做好的入口。过去的实时语音方案多为”回合制”,用户说完一段、系统再回应,打断和思考停顿容易被误判。GPT-Live-1 的核心价值在于把这条链路收进单一模型:延迟更低,打断处理更准,也让语音智能体具备真正落地业务的条件。OpenAI 公布的评测显示,该模型在 Full Duplex Bench 上比 GPT-Realtime-2.1 高出 30 个百分点;在 Tau3 端到端语音智能体任务中,与 GPT-6Astra 组合、采用中等推理强度时排名第一。语言学习平台 Speak 在早期评估中,学习者思考停顿导致的误打断减少近 80%。这些数据能否在更广泛场景复现,目前公开信息显示仍待验证。

对用户/开发者/创作者的影响

对开发者而言,接入门槛下降:无需自行拼接 ASR、LLM 和 TTS 三段管线,架构更简单。医疗服务平台的案例显示,使用该模型后代码量显著减少、架构得到精简。对企业和创作者而言,电话客服、餐厅预订、企业系统查询等全双工语音智能体成为可开发的方向。不过,语音场景涉及通话录音、企业数据与操作权限,合规与授权设计仍是落地前提。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是定价与并发能力,决定中小团队能否长期使用;二是真实场景下的打断准确率和多语言表现,尤其是中文口音与嘈杂环境;三是竞品是否跟进端到端语音模型,以及 OpenAI Presence 在企业系统集成上的实际开放程度。

来源:AIbase

celebrityanime
celebrityanime
文章: 22782

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注