Tencent 的 Gander 力求在后台干活时还能一直对话

腾讯混元语音团队联合多所高校推出 Gander,一个把"实时对话"和"后台干活"拆成两套系统的 AI 模型,试图解决语音助手"要么反应快、要么想得深"的老问题。测试显示它打断用户最少,但任务准确率暂时落后。

一句话看懂:腾讯混元语音团队联合多所高校推出 Gander,一个把”实时对话”和”后台干活”拆成两套系统的 AI 模型,试图解决语音助手”要么反应快、要么想得深”的老问题。测试显示它打断用户最少,但任务准确率暂时落后。

事件核心:发生了什么

根据 The Decoder 2026 年 9 月 20 日的报道,腾讯混元语音团队与多所大学研究者发布技术报告,介绍了 Gander 模型。它的核心设计是把工作拆成两部分:一个”小脑”负责逐秒处理对话,决定何时听、何时说、何时被打断;一个可替换的”大脑”负责推理和复杂任务,比如修 bug、写代码、等待某张幻灯片出现。用户在后台任务执行期间可以随时插话、追加需求,例如要求补充 Python 3.12 兼容性。

该模型同时处理语音、图像和文本,按 1 秒一段切分对话,大约用最近两分钟的上下文做记忆,且不需要单独的语音起止检测模块。测试中,大脑角色由 GPT-5.6 系列中的一个未指明模型担任,意味着它可以换成 Codex、Claude Code 等不同 agent 系统而无需重训对话模型。训练数据约 270 万条,团队计划在完成开源流程后公开模型权重和训练数据,GitHub 代码仓库已存在。

为什么重要

当前主流语音助手基本是”回合制”:用户说完,模型再回应。Gander 走的是全双工路线,把”响应速度”和”规划深度”解耦,回应了业界一个真实矛盾——实时对话要求低延迟,而复杂 agent 任务天然需要更长推理时间。用可替换大脑的设计,也让系统能随底层模型升级而整体受益,不必反复重训对话层。

数据上,Gander 在 Full-Duplex-Bench v3 的 100 个场景中全部在正确时机开口,打断用户比例仅 8%,对比 GPT-Realtime 的 13.5% 和最弱竞品的近 48%。不过它的任务准确率略低于最弱竞品,视频和音频理解也弱于其基座模型,研究者归因于训练偏向流畅对话而非精确感知。此外,目前还没有针对这类系统的标准评测方法。

对用户/开发者/创作者的影响

对开发者而言,可替换大脑意味着可以用同一套对话层接入不同 agent 后端或 API,降低切换成本;一旦权重和数据开源,做语音交互、实时助手、多模态应用的门槛会进一步下降。对创作者和企业用户,后台任务加不间断对话的形态,可能更适合边操作边沟通的工作流,比如边改稿边讨论、边排查问题边追问。但现阶段准确率和多模态感知的短板,说明它还不适合直接用于对精度要求高的生产场景。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是权重和训练数据是否真正开源,以及 GitHub 仓库的更新节奏;二是任务准确率和视频/音频理解能否在后续版本改善;三是这套”小脑+大脑”架构是否会被其他厂商跟进,以及行业能否形成统一的评测标准。

来源:The Decoder AI News

celebrityanime
celebrityanime
文章: 24622

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注