一句话看懂:OpenAI 于 2026 年 9 月 10 日把 ChatGPT 里的全双工语音模型 GPT-Live-1 开放到 API,开发者可以拿它搭建能边听边说、支持打断的电话与客服类语音代理。
事件核心:发生了什么
GPT-Live-1 最早在 ChatGPT 中推出,现在正式进入 API。它的特点是“全双工”:单个模型同时处理输入的音频和输出的音频,而不是把语音转文字、文本大模型推理、文字转语音三段拼在一起。OpenAI 称,该模型可把更深的推理和工具调用交给后端文本模型(如 GPT-6 Astra)或第三方模型处理,开发者还能通过 system prompt 控制语音代理的语气、语速和对话风格,并原生提供 ASR 转写和回复文本。
开放的能力还包括:更好的打断处理、静音与背景噪声管理、长会话上下文保持,以及对电话场景的支持。OpenAI 公布的数据是:相比 GPT-Realtime-2.1,GPT-Live-1 在 Full Duplex Bench 上提升约 30 个百分点;在搭配 GPT-6 Astra 中等推理强度时,语音代理端到端任务评测 Tau3 排名第一。语言学习平台 Speak 的早期评测显示,GPT-Live-1 让学习者有更多思考时间,打断次数比此前的轮次式系统减少近 80%;医疗沟通平台将级联架构换成 GPT-Live-1 后,代码量减少 80%,删掉约 2.3 万行代码。
为什么重要
语音代理长期受限于“拼接式架构”:每一步交接都会带来延迟,也容易丢失上下文和对话节奏,打断、停顿、改主意这些真实场景尤其难处理。GPT-Live-1 把听和说收进一个模型,等于把语音层简化,把复杂推理留给后端模型。这既是技术路线的分化——端到端全双工 vs 级联 STT-LLM-TTS,也直接影响成本与延迟结构。
对 OpenAI 而言,这是在 Realtime 系列之外继续巩固语音 API 的护城河,并与仍在优化级联方案的云厂商和语音创业公司正面竞争。目前公开信息显示,GPT-Live-1 仍支持传统轮次检测,方便已有系统迁移,而不是强制开发者重写全部逻辑。
对用户/开发者/创作者的影响
开发者最直接的变化是语音代理架构变简单:不必再自己协调 STT、LLM、TTS 三段的时序和打断逻辑,可以按任务复杂度选择后端模型——高频的排期、订单查询用轻量模型,复杂客诉再切到 Astra 这类推理模型。电话客服、预订、陪练类应用会是最先受益的场景。创作者和企业采购方则可以关注两点:语音交互的响应延迟是否下降,以及长会话中上下文是否真的保持稳定。需要注意的是,目前演示是限时的,API 定价、速率限制和地区可用性尚未在素材中给出。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
一是 GPT-Live-1 在 API 上的定价与并发能力,这会决定它能否替代现有级联方案;二是 Tau3 等评测中的领先能否在真实客服、医疗等高合规场景中复现;三是谷歌、亚马逊及语音创业公司是否会跟进全双工模型,以及电话场景的录音、隐私和合规要求是否影响上线节奏。
来源:OpenAI News


