Google 推出 Gemini 3.8 Live,以远低于 OpenAI GPT-Live-1 的成本发起挑战

Google DeepMind 发布 Gemini 3.8 Live 与 3.8 Live Extended Thinking 两款实时音频模型,通过 Gemini API 和 Google AI Studio 向开发者开放,以每分钟约 0.005 美元的音频输入定价正面挑战 OpenAI 的 GPT-Liv…

一句话看懂:Google DeepMind 发布 Gemini 3.8 Live 与 3.8 Live Extended Thinking 两款实时音频模型,通过 Gemini API 和 Google AI Studio 向开发者开放,以每分钟约 0.005 美元的音频输入定价正面挑战 OpenAI 的 GPT-Live-1。

事件核心:发生了什么

2026 年 9 月 15 日,Google DeepMind 推出 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款音频模型,开发者可通过 Gemini API 与 Google AI Studio 调用,官方也在 GitHub 放出了示例应用。Gemini 3.8 Live 能驱动语音智能体在通话过程中后台调用 API、处理视觉输入,并保持连续对话,支持 97 种以上语言。定位更高的 Extended Thinking 版本在 Artificial Analysis 语音到语音排行榜上以 82.6% 位列第一,超过 OpenAI 最新的 GPT-Live-1 系列。价格是这次发布最直接的变量:Google 音频输入每分钟 0.005 美元、输出 0.018 美元,而 OpenAI GPT-Live-1 约为每分钟 0.05 美元。按此推算,一小时语音对话在 Google 侧约 1.38 美元,OpenAI 侧至少 3 美元。

为什么重要

语音交互正从演示走向可计费的生产力场景,单位成本直接决定语音智能体能否规模化部署。Google 这次把价格压到对手的十分之一量级,同时用 Extended Thinking 版本在第三方榜单上拿到第一,等于同时打价格和技术两张牌。但原文也指出,OpenAI 的模型依靠全双工能力可以边听边说,对话自然度可能更好,演示音质也更佳——目前公开信息显示,Google 这一轮更像是用价格优势换市场份额,而非在体验上全面领先。对闭源大模型 API 市场来说,音频推理这条产品线的价格战可能就此开启。

对用户/开发者/创作者的影响

对开发者,语音智能体的成本结构明显改善。一小时的客服或陪伴类语音应用,API 支出从至少 3 美元降到约 1.38 美元,长时段场景的可行性提高,适合先做原型再评估规模化。多语言支持和后台 API 调用能力,也让语音 Agent 更容易接入现有业务系统。对创作者和产品团队,实时语音内容、互动音频应用的试错成本下降。不过需要注意,低价主要覆盖音频输入输出,视觉输入、后台工具调用以及 Extended Thinking 版本的实际计费和延迟表现,还需在项目中实测。企业采购如果更看重对话自然度和音质,GPT-Live-1 仍有保留价值。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是 Gemini 3.8 Live 在真实并发场景下的延迟与稳定性,是否与低价相匹配;二是 OpenAI 是否对 GPT-Live-1 调价或推出更便宜的音频档位;三是 Extended Thinking 版本的榜单优势能否转化为开发者实际采用,以及全双工能力是否会被 Google 补上。

来源:The Decoder AI News

celebrityanime
celebrityanime
文章: 23691

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注