OpenAI 复盘:我们是如何在 6 个月内完成构建 GPT-Live 实时语音系统的 GPT-Live 是OpenAI 最新一代的语音模型,它摒弃了原有的“轮流检测器”,实现了全双工(Full-duplex)——即 AI 可以边听边说,完全模仿真人的对话习惯。 为了做到不到 1 秒的极致超低延迟,OpenAI 在底层技术上做了重磅升级。 “嘴巴”和“大脑”分工合作(异步委托机制): 快路径(前端语音):专门负责“聊天和接话”,把语音…

OpenAI 用 6 个月时间构建了新一代实时语音模型 GPT-Live,通过“快慢双路径”架构和自研传输协议,把语音交互延迟压到 1 秒以内,实现了 AI 边听边说的全双工对话。

一句话看懂:OpenAI 用 6 个月时间构建了新一代实时语音模型 GPT-Live,通过“快慢双路径”架构和自研传输协议,把语音交互延迟压到 1 秒以内,实现了 AI 边听边说的全双工对话。

事件核心:发生了什么

据 @xiaohu 发布的公开信息,OpenAI 复盘了 GPT-Live 实时语音系统的构建过程。这是 OpenAI 最新一代语音模型,核心变化是放弃了传统“轮流检测器”机制,改用全双工模式,让 AI 可以同时进行听和说,交互方式更接近真人对话。

为了实现不到 1 秒的端到端延迟,GPT-Live 在底层做了两项关键改动。第一是引入异步委托机制:负责语音交互的“快路径”直接处理聊天和接话,遇到复杂推理、搜索或工具调用时,则由“慢路径”在后台异步调用 GPT-5.5 等大模型,再把结果返回语音模型。第二是重构传输层:媒体前端和推理逻辑从 Python 迁移到 Go 语言,以降低音频数据包的延迟抖动;同时基于 WebRTC 优化并开源了自定义传输协议 WARP,将建立语音连接所需的网络往返次数从 6 次压缩到 1 次,甚至单个 UDP 包即可启动连接。

为什么重要

GPT-Live 的技术路线展示了实时语音交互的一种新解法:用分工而非堆算力的方式解决延迟问题。快路径保证对话的即时性,慢路径保留深度推理能力,这种“异步委托”设计可能影响后续语音助手的架构选择。

值得关注的是 WARP 协议被开源。传输层一直是语音交互体验的隐性瓶颈,OpenAI 将自定义协议对外开放,意味着开发者有机会在自有产品中复用这套低延迟连接方案,也可能推动 WebRTC 生态向更轻量的方向演进。与此同时,这一进展也会给闭源语音助手和开源语音模型两条赛道同时带来压力——对手需要在延迟和成本之间重新找平衡。

对用户/开发者/创作者的影响

对普通用户来说,最直观的变化是 AI 语音对话不再有明显的“你说完、它思考、它开口”的停顿感,打断和插话成为可能,交互更接近与人打电话。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对开发者而言,WARP 协议和 GPT-Live 的架构思路提供了可参考的实现路径:如果后续 OpenAI 开放相关 API,实时语音应用(如客服、陪伴类应用、语音笔记工具)可以在不依赖重型设备端模型的情况下获得低延迟能力。

对创作者和内容生产者,全双工语音意味着播客、访谈、直播等场景中的 AI 参与方式可能改变——AI 不再只是被动应答的“语音助手”,而是能实时接话、抢话甚至引导话题的对话参与者。不过目前公开信息显示,GPT-Live 尚未公布面向公众的开放时间表,实际可用的产品形态仍需等待。

值得关注的后续

接下来可以重点观察三个方向:一是 GPT-Live 是否会通过 API 向开发者开放,以及调用价格如何设定;二是 WARP 协议能否在开源社区形成采用,成为语音传输层的事实标准;三是竞品(如 Google、Meta 及国内大模型厂商)是否会跟进全双工语音架构,并压低延迟门槛。

来源:@xiaohu

celebrityanime
celebrityanime
文章: 16844

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注