OpenAI 的 GPT-Live-1 API 让开发者能打造同时说话和聆听的应用

OpenAI 将 GPT-Live-1 语音模型开放为 API,它支持“全双工”交互,也就是边说边听,开发者可以把这种接近真人对话的能力接入自己的应用,但每分钟 0.05 美元的价格也意味着成本不低。

一句话看懂:OpenAI 将 GPT-Live-1 语音模型开放为 API,它支持“全双工”交互,也就是边说边听,开发者可以把这种接近真人对话的能力接入自己的应用,但每分钟 0.05 美元的价格也意味着成本不低。

事件核心:发生了什么

2026 年 9 月 10 日,OpenAI 宣布把 GPT-Live-1 以 API 形式提供给开发者。这个语音模型的核心能力是“全双工”:它能同时说话和聆听,而不是传统语音助手那种“你说完我再说”的轮流模式。该模型目前已经在 ChatGPT 内部运行。

开发者可以把 GPT-Live-1 与不同的后端模型搭配,根据任务需要平衡推理深度、响应速度和成本。定价为每分钟 0.05 美元。Yelp 已经在用它处理电话预订,据其 CTO Alex Levy 表示,通话处理效果有所改善。

在 OpenAI 公布的基准测试中,GPT-Live-1 明显领先前代:全双工交互测试得分 80.1%,而 GPT-Realtime-2.1 为 45.4%;轮流对话延迟从 1.4 秒降到 0.8 秒;工具调用准确率从 60% 提升到 87%;银行语音支持基准通过率从 12.4% 升至 32%。此外还新增了十二种覆盖不同口音、方言和语言的语音,并开箱提供 ASR 转写和回复文本。

为什么重要

全双工语音一直被视为语音 AI 从“能用”走向“自然”的关键门槛。它决定的不只是对话流畅度,还有机器能否像人一样处理打断、附和、抢话和情绪变化。GPT-Live-1 把这类能力做成 API,意味着语音交互不再是少数大厂的专利,中小开发团队也能调用。

从竞争格局看,这延续了 OpenAI 把内部能力持续产品化、平台化的路线。与 GPT-Realtime-2.1 的数据差距说明语音模型的迭代还在加速,而 Yelp 这类真实商业场景的落地,也在为语音客服、预订、外呼等高价值场景提供参考。价格层面,每分钟 0.05 美元对高频通话场景并不便宜,这会直接影响开发者的成本结构和商业化设计。

对用户/开发者/创作者的影响

对开发者来说,最直接的变化是可以用一套 API 构建“可打断、可实时回应”的语音应用,而不必自己拼接语音识别、大模型推理和语音合成三段链路,工程复杂度明显下降。与不同后端模型搭配的灵活性,也让团队能按场景选择更便宜或更强的推理模型。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对企业和创作者而言,电话预订、语音客服、语音陪伴、互动内容等方向的门槛被压低。但需要算清账:按分钟计费意味着长时间通话成本会快速累积,产品设计上要控制通话时长或做分级定价。目前公开信息显示,GPT-Live-1 输出的是 ASR 转写和回复文本,创作者可以在此基础上做字幕、摘要或内容再加工,这一层的二次开发空间值得关注。

值得关注的后续

第一,价格是否下调或推出阶梯套餐。0.05 美元每分钟直接决定语音应用能否大规模铺开,尤其对客服和呼叫中心类场景。第二,竞品是否跟进全双工。谷歌、Meta 以及国内大模型厂商在这条路线上的动作,会影响整个语音 API 市场的定价和技术节奏。第三,Yelp 等早期案例的实际效果能否持续验证,以及开发者生态中是否出现真正高频、可复制的语音应用形态。这些都是判断 GPT-Live-1 是阶段性更新还是语音交互转折点的关键观察点。

来源:The Decoder AI News

celebrityanime
celebrityanime
文章: 22742

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注