Gemini Live audio

Google 发布了 Gemini 3.8 Live 和 3.8 Live Extended Thinking 两款语音到语音模型,形态上对标 OpenAI 的 GPT-Live 系列;开发者 Simon Willison 用 WebSocket 和 Web Audio API 做了一个零依赖的浏览器试玩界面…

一句话看懂:Google 发布了 Gemini 3.8 Live 和 3.8 Live Extended Thinking 两款语音到语音模型,形态上对标 OpenAI 的 GPT-Live 系列;开发者 Simon Willison 用 WebSocket 和 Web Audio API 做了一个零依赖的浏览器试玩界面,可以直接开口对话并打断模型。

事件核心:发生了什么

2026 年 9 月 15 日,Google 推出 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking 两个新模型,定位是 speech-to-speech,即语音输入直接生成语音输出,而不是“语音转文字再转语音”的串联方案。这与 OpenAI 的 GPT-Live 家族属于同一产品形态。

同日,Simon Willison 发布了一个用于试玩新模型的网页 UI:可选择模型和音色预设、填写可选的 system prompt,然后通过浏览器开始语音对话,并且支持在模型说话时打断它。该实现不依赖任何第三方库,直接连接 wss://generativelanguage.googleapis.com 下的 BidiGenerateContent WebSocket 端点,采集与播放都走 Web Audio API 的 AudioContext。他同时给出了对应的 Gemini Live 教程链接。

为什么重要

语音到语音正在成为大模型竞争的一条独立产品线。相比传统流水线,端到端语音模型在延迟、语气保留和“可打断”这类交互体验上有明显差异,这也是实时语音助手能否真正可用的关键。Google 这次以 Live 和 Live Extended Thinking 两条规格出现,说明它希望同时覆盖低延迟对话和更强推理两类场景,而不是只做一个语音壳。

另一层意义在接入方式。BidiGenerateContent 这种双向流式 WebSocket 端点,把实时语音能力开放给普通 Web 前端,不需要专门的客户端 SDK 或额外的推理服务。这意味着语音 AI 应用的开发门槛被进一步压低。

对用户/开发者/创作者的影响

对开发者来说,最直接的变化是实时语音应用的实现路径变短了:一个 WebSocket 连接加 AudioContext,就能在浏览器里完成采集、播放和打断,不必再拼装多个云服务。对创作者,可打断的语音对话更接近真实访谈和口播协作,适合做语音内容草稿、角色配音试验。对普通用户,目前公开信息显示这仍偏向开发者与尝鲜者场景,尚未看到消费级产品的完整定价与稳定性数据。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是 Gemini 3.8 Live 与 Extended Thinking 在延迟和推理质量上的实际差距,是否值得为后者付出响应时间;二是该 WebSocket API 的配额、计费和正式版(v1alpha 之外的稳定性)如何落地;三是 OpenAI GPT-Live 系列是否会在同类交互能力上跟进定价或功能调整。语音到语音这条线的竞争,接下来大概率会围绕“可打断、低延迟、可组合工具调用”展开。

来源:Simon Willison

celebrityanime
celebrityanime
文章: 23711

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注