
一句话看懂:OpenAI 于 2026 年 7 月 23 日面向全球桌面端用户(macOS 和 Windows)推出 ChatGPT Voice 功能,允许用户通过语音同时控制运行在 ChatGPT Work 或 Codex 中的多个 AI 智能体。这意味着 AI 助手从单一的对话界面,正式进入可语音调动多任务、多智能体协作的阶段。
事件核心:发生了什么
OpenAI 官方账号宣布,ChatGPT Voice 功能已正式上线桌面版应用。该功能由 GPT-Live 新一代模型驱动,能够同时执行语音识别、语音对话以及应用内的任务调度。用户只需口头指令,即可让多个智能体在 ChatGPT Work 或 Codex 开发环境中并行工作。支持的计划包括 Plus、Pro、Business、Edu 和 Enterprise 级别。此外,iOS 版 ChatGPT 已可通过 Codex 进行远程配对访问,实现移动端控制,Android 版也将在近期跟进。数据显示,该公告在发布后一小时便获得了超过 35 万次观看量,反映出市场的强烈关注。
为什么重要
这次更新有三大深远意义。首先,它打破了 AI 助手“一问一答”的交互模式。过去用户需要通过文本输入逐步引导完成任务,而现在语音交互结合多智能体,意味着用户可以用近乎自然语言的方式,同时指挥 AI 做数据分析、代码编写和内容生成,极大降低了多人协作的沟通成本。其次,GPT-Live 模型的发布表明 OpenAI 正在构建一个可以实时感知、听、说并协调执行动作的统一多模态模型,这被视为通往更主流 AI 助理级产品的重要技术基础。最后,语音控制的桌面端应用直接拉高了竞品入局门槛——桌面端语音+多智能体的组合让 AI 从“聊天工具”转向“生产力操作系统”,对微软 Copilot、Google Gemini 等对手形成明确的产品差异。
对用户/开发者/创作者的影响
对企业与专业用户:使用 ChatGPT Work 的团队现在可以在处理复杂项目时,通过语音直接向多个智能体分配任务,例如“分析这份销售数据,同时生成摘要邮件,再检查一下代码仓库的测试覆盖率”,大幅减少了手动界面操作时间。对开发者:Codex 环境下的多智能体语音控制将允许程序员在调试、重构代码时保持双手不离开键盘,仅用语音指挥 AI 执行单元测试或代码审查,有望提升开发效率。不过,需注意目前仅支持 Plus 及以上付费计划,免费用户暂时无法体验。对内容创作者:语音交互降低了使用门槛,创作流程(如文案生成、图像构思与大纲整理)可以更自然地并行推进,但实测中多智能体协同的稳定性仍有待验证。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
第一,实际使用中的延迟和准确度。GPT-Live 需要在同一应用内同时处理听、说、执行多个智能体,对算力和网络延迟要求极高,预计初期部分用户的体验可能不够流畅。第二,价格结构可能调整。由于调用多智能体和实时语音模型对算力消耗更大,OpenAI 是否会调整高级版计费策略或推出按量付费模式,值得密切关注。第三,竞品快速跟进。微软已在 Windows 上深度整合 Copilot 语音,Google 也在加速 Gemini 桌面端功能布局。如果 OpenAI 不能在后续迭代中持续优化开发者和生态支持,当前先发优势可能被快速追平。第四,Android 版的支持时间尚未明确公布,可能影响非 iOS 移动端用户的工作流连续性。


![RuntimeError: shape '[32, 64, 576]' is invalid for input of size 1343488](https://www.chat-gpts.plus/wp-content/uploads/2026/07/48896-f8250d36-768x403.jpg)