微软首款自研全双工 AI 语音模型曝光:听说并行,16 种语言自由切换

微软正在测试自研的实时语音模型 MAI Realtime,它支持 16 种语言,能边听边说、允许用户随时打断。语音助手正在从“轮流说话”走向“同时听说”,这对聊天体验和语音应用开发都会产生直接影响。

一句话看懂:微软正在测试自研的实时语音模型 MAI Realtime,它支持 16 种语言,能边听边说、允许用户随时打断。语音助手正在从“轮流说话”走向“同时听说”,这对聊天体验和语音应用开发都会产生直接影响。

事件核心:发生了什么

据科技媒体 TestingCatalog 报道,微软近期开始测试其首款原生实时语音模型 MAI Realtime。该模型采用全双工交互方式,不再沿用传统语音助手“用户说完、AI 再回答”的轮询式对话,而是通过端点检测技术识别语音的开始、暂停和结束。用户在 AI 说话过程中随时插话,模型都能立即调整输出,实现真正意义上的边听边说。

MAI Realtime 支持中文、英语、日语、韩语、法语、德语、阿拉伯语等 16 种语言,并具备自动语言检测能力,可在对话进行中自动切换语种。测试版本提供 Victoria 和 Grant 两种语音风格,据称比 Copilot 目前的语音模式更加自然。此前微软发布的 MAI-Voice-2 和 MAI-Transcribe-1.5 仍停留在语音合成或语音识别这样的单向任务上,MAI Realtime 则代表了 MAI 语音模型家族从单双向双向通信的关键升级。

为什么重要

全双工语音并非新概念,但把它直接做进自研大模型并面向消费级产品落地,意味着语音交互的产品逻辑正在改变。过去用户必须等待 AI 说完才能回应,这在复杂对话中会带来明显延迟和打断成本;而 MAI Realtime 让“说话”与“倾听”同时发生,对话节奏更接近人际交流。

从行业竞争看,微软此前在实时语音能力上依赖 Copilot 的既有语音模式,MAI Realtime 的曝光表明微软正在加快自研语音模型的节奏,减少对第三方能力的依赖。这一方向也与 OpenAI、Google 等公司推动实时语音 API 的趋势形成直接竞争,语音交互的技术路线正在从“识别-理解-生成”的流水线,逐步转向端到端的全双工模型。

对用户/开发者/创作者的影响

对普通用户来说,最直观的变化是对话不再有“轮到谁说话”的僵硬感:AI 不会在你打断时强行说完,语言切换也会更省事。对开发者而言,如果 MAI Realtime 后续开放 API,全双工能力将降低实时语音应用的门槛,比如更自然的客服机器人、实时翻译通话、语音助手插件等都可能出现新玩法。对创作者和内容团队来说,这类模型也可能改变语音内容的制作方式——不用再严格按脚本整段录制,而是可以通过自然对话直接生成多语言语音素材。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

目前公开信息显示,MAI Realtime 仍处于测试阶段,有三个问题值得跟踪:第一,它何时集成进 Copilot 或面向开发者开放,是否提供 API 及具体定价;第二,测试中语音的打断稳定性、延迟表现是否真正达到宣传效果,尤其在不同口音和嘈杂环境下表现如何;第三,OpenAI、Google 等竞品是否会加快全双工语音模型的更新节奏,从而推动这一能力在短期内成为主流配置而非稀缺卖点。

来源:AIbase

celebrityanime
celebrityanime
文章: 16797

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注