一句话看懂:OpenAI 新发布的全双工语音模型 GPT-Live-1,在 Artificial Analysis 的 Speech to Speech Index 上以 81.5 分登顶,超过 Grok Voice Think Fast 2.0。它最大的特点是可以在对话的同时,把推理和工具调用交给一个独立配置的后端文本模型。
事件核心:发生了什么
Artificial Analysis 在 9 月 15 日公布了 Speech to Speech Index 的最新评测结果。OpenAI 的 GPT-Live-1 首次上榜即排名第一,得分 81.5,使用的是 Astra 作为后端文本模型(中等推理强度)。同一模型的另一种配置——Sol 后端、低推理强度——得分为 80.1,排名第三。Grok Voice Think Fast 2.0 High 以 81.3 分夹在两者之间。
GPT-Live-1 是一款全双工语音模型,开发者通过 API 持续输入音频流,模型实时返回语音,后端文本模型可以单独配置,用于承担推理和工具调用。在 Agent 性能测试 Tau Voice 上,Astra 配置拿到 67.9%,Sol 配置 59.3%,均高于 Grok 的 56.5%。但在音频推理测试 Big Bench Audio 上,它落后于 Grok(97.2%)和 Qwen Audio 3.0 Realtime Plus(99.2%)。
为什么重要
GPT-Live-1 的核心变化在于架构分工:语音模型负责实时对话,文本模型负责推理与工具调用。这意味着语音 AI 的“智能上限”不再被单一模型绑定,开发者可以按成本、延迟、任务复杂度灵活替换后端。对闭源商业 API 而言,这是一个更偏工程化的产品思路,区别于追求端到端一体化的大模型路线。
但评测也揭示了取舍。GPT-Live-1 的语音响应首包时间约 1.24 至 1.34 秒,明显慢于 Grok 的 0.70 秒;音频推理分数也低于 Grok 和 Qwen。换句话说,它在“能干活”的 agentic 场景更强,在纯听辨理解上并非全面领先。Speech Agent Arena 上它排在第 3、第 4 位,任务成功率 87.4% 到 90.9%,也不及 Grok 的 94.6%。
对用户/开发者/创作者的影响
对开发者,GPT-Live-1 提供了一种可拆分的语音应用搭建方式:语音层和后端文本模型分别配置,适合做实时客服、语音助手、会议代理等需要边听边查工具的场景。成本方面,Astra 配置约每小时输入音频 5.83 美元,Sol 配置 4.47 美元,已包含后端模型调用费用,对比 Grok 的 4.80 美元,价格差距不大。真正要权衡的是延迟与推理能力的匹配。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
对普通用户和创作者,目前它主要还停留在 API 层面,尚未看到面向终端用户的成品形态。选择语音产品时,评测数据说明“综合第一”并不等于每项都第一,音频理解、响应速度和任务完成率需要分开看。
值得关注的后续
一是 GPT-Live-1 何时进入 OpenAI 面向开发者的正式产品体系,是否有更明确的价格分层;二是低延迟竞品是否会跟进“前端语音+后端推理”的分离架构;三是第三方评测在不同音频场景、不同语言下的复现结果,尤其是中文语音环境下的表现目前公开信息有限,值得继续观察。


