How we built a realtime system for responsive voice AI in six months

OpenAI 在 2026 年 8 月 3 日发布第三代语音系统 GPT-Live,取消了传统语音 AI 依赖的“话轮检测器”,让模型能同时听和说。这项架构变动意味着语音对话延迟将大幅降低,交互节奏更接近真人。

一句话看懂:OpenAI 在 2026 年 8 月 3 日发布第三代语音系统 GPT-Live,取消了传统语音 AI 依赖的“话轮检测器”,让模型能同时听和说。这项架构变动意味着语音对话延迟将大幅降低,交互节奏更接近真人。

事件核心:发生了什么

OpenAI 工程团队成员 Justin Uberti 与 Zahan Malkani 在官方博客中详细介绍了 GPT-Live 的系统设计。与以往“语音转文字—大模型处理—文字转语音”的级联架构不同,GPT-Live 采用全双工(full-duplex)语音模型,音频直接流入流出模型,不再需要独立的“话轮检测器”来判断用户是否说完。系统还引入了有状态推理(stateful inference)、动态上下文管理、异步委托和协议级优化,将媒体流转与业务逻辑分离,避免工具调用或后端服务拖慢对话响应。

这套架构还支持按需调用 GPT-5.5 等前沿模型进行深度推理,同时保持对话不中断。目前该能力已集成到 ChatGPT Voice,并支持在 ChatGPT 桌面应用中控制电脑、协调智能体。

为什么重要

过去语音 AI 的延迟瓶颈不在大模型本身,而在“何时开始推理”的判断上:检测器猜太早会打断用户,猜太晚则响应迟钝。GPT-Live 把话轮检测器移出音频路径,让模型直接处理连续语音流,是从“回合制交互”到“流式交互”的架构转变。这也让语音 AI 首次在系统层面具备了人类对话中的打断、重叠和即时反馈能力。

对行业而言,OpenAI 选择将完整工程方案公开,等于把语音交互的延迟竞争从模型效果层面拉到了系统架构层面。其他语音 AI 玩家若想追赶,不仅需要更强的语音模型,还需要重构推理与媒体传输链路。这可能会加速整个行业对全双工语音架构的跟进。

对用户/开发者/创作者的影响

普通用户最直接的感受是 ChatGPT Voice 的对话更自然,可以随时插话、纠正,不必等对方“把话说完”。新增的桌面端电脑控制与智能体协调能力,也让语音成为操作 AI 代理的实用入口。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

开发者和企业可以关注 Realtime API 的方向性变化:GPT-Live 的架构为第三方应用提供了新范式——通过异步 RPC 边界解耦工具调用与媒体流,开发者可以在不牺牲响应速度的前提下接入自定义工具、策略和后端逻辑。创作者则可以围绕连续语音交互设计新的应用场景,例如语音驱动的实时协作、直播互动或无障碍辅助工具。

值得关注的后续

目前公开信息显示,GPT-Live 已随 ChatGPT Voice 推出,但具体开放范围、API 接入方式和价格尚未完全明确。后续值得观察三点:一是 GPT-Live 是否会通过 Realtime API 向开发者开放,以及调用成本如何;二是 Google、Anthropic 等竞品是否会跟进全双工语音架构;三是 OpenAI 是否公布端到端延迟的具体指标,供行业做横向对比。

来源:OpenAI News

celebrityanime
celebrityanime
文章: 16744

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注