
一句话看懂:Anthropic 升级了 Claude 的语音模式,现在它可以在对话中调用更强的 Sonnet 和 Opus 模型,并接入 Gmail 和 Slack 等外部应用上下文。这弥补了此前语音模式只能使用轻量模型 Haiku、难以处理复杂请求的短板。
事件核心:发生了什么
当地时间 2026 年 7 月 23 日,Anthropic 发布语音模式更新。此前,为了降低延迟,所有语音输入请求都默认通过最小的 Haiku 模型处理,导致复杂对话时表现不佳。现在,付费用户可以在语音对话中使用 Sonnet 或 Opus 模型,且默认跟随用户最后一次使用的文本聊天模型;对话中途也可通过模型选择器切换模型。Anthropic 表示语音模式会使用所选模型的最快版本以保证流畅性。
另一项关键变化是语音模式现在可以获取已连接的第三方应用(如 Gmail、Slack)的上下文信息,前提是用户授权。在技术架构上,Claude 语音采用“轮流对话”——即听完用户说话、暂停思考、再回复——并非像 OpenAI 的 GPT-Live 系统那样支持全双工(同时处理输入与输出)。此外,语音模式目前不能自动检测对话中的语种切换,用户需提前告知或手动在设置中选择;但 Anthropic 新增了对包括印尼语在内的多种语言的支持。
该功能以 Beta 形式面向桌面端、移动端和网页端用户推送。免费账户仍限定只能使用 Haiku 模型,且每次仅允许一个语音连接。
为什么重要
此次升级直接回应了“语音模式只能应付简单问题”的批评,通过开放更强模型接入,使语音交互从“基础问答”向“复杂工作流”延伸。这背后是 Anthropic 在语音交互层面追赶 OpenAI 的关键一步——尽管全双工技术尚未落地,但将语音与模型能力解绑,实际上拓宽了语音模式在真实办公场景中的可用性。接入 Gmail、Slack 等工具上下文,则暗示 Anthropic 正在将语音定位为“能够理解用户数字生态的智能入口”,而非独立的对话玩具。对行业而言,这进一步压缩了纯文本交互的空间,语音+工具调用的组合正在成为 AI 助理的标准配置。
对用户/开发者/创作者的影响
普通用户:付费订阅用户可以更自然地用语音下达复杂指令,例如让 Claude 在 Slack 中查找某条信息并语音念出摘要;免费用户的使用体验基本不变。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
开发者:语音模式现在接入外部应用上下文,意味着开发者在构建基于 Claude 的语音交互应用时,可以请求用户授权并直接调用已连接的 Gmail/Slack 数据,降低开发复杂度。但由于不支持全双工,仍不适合需要实时打断或边听边答的场景。
创作者与知识工作者:可以通过语音快速获取邮件内容、会议要点等结构化信息,并结合 Opus 模型进行深度分析;语种切换需要手动操作,跨国协作场景仍有摩擦。
值得关注的后续
第一,全双工功能何时落地。Anthropic 目前采用“轮流对话”架构,与 OpenAI 的 GPT-Live 相比在实时互动上存在差距,这将是后续版本的关键差异点。第二,外部工具集成生态是否会进一步扩大。目前仅支持 Gmail 和 Slack,未来能否开放 API 给更多 SaaS 产品,会直接影响语音模式的实用深度。第三,模型切换带来的延迟与成本。语音模式使用“所选模型的最快版本”,但 Opus 推理成本高于 Haiku,Anthropic 是否会对高模型语音使用单独计费,目前公开信息尚未披露。
来源:Engadget


