AI语音交互再升级:OpenAI桌面端ChatGPT上线新功能,支持语音操控电脑执行多步骤任务

OpenAI在桌面版ChatGPT中正式上线ChatGPT Voice语音功能,让用户可以通过语音指令驱动AI在电脑上自主完成多步骤操作。这意味着语音交互从“聊天”走向“执行”,AI助手开始具备端侧操作能力。

一句话看懂:OpenAI在桌面版ChatGPT中正式上线ChatGPT Voice语音功能,让用户可以通过语音指令驱动AI在电脑上自主完成多步骤操作。这意味着语音交互从“聊天”走向“执行”,AI助手开始具备端侧操作能力。

事件核心:发生了什么

8月10日,OpenAI宣布桌面版ChatGPT正式支持ChatGPT Voice功能。该功能基于本月早些时候发布的ChatGPT-Live系列语音模型,目前已全面支持ChatGPT Work和Codex,用户可直接通过语音向AI发出复合指令,并可在AI需要补充信息或二次确认时进行交互式回应。在官方演示中,开发者仅用一条语音指令,就引导AI创建新的代码线程、提交Pull Request,并定位到Bug根因。

值得注意的是,macOS系统用户结合Appshots特性,可以授权AI访问屏幕上的全部内容及替代文本(alt-text),从而让语音控制覆盖更多桌面应用场景。OpenAI还确认,通过iOS应用的远程访问功能,用户也能调用Codex中的ChatGPT Voice。

为什么重要

此前的移动端语音功能,重点在于提供流畅的对话体验和优化打断处理,本质上仍是“聊天工具”的延伸。而这次桌面端更新,标志着语音从一个输入模态升级为Agent的控制接口——用户不再需要逐条打字或点击,而是用自然语言指挥AI执行跨应用、多步骤的复杂任务。这对AI助手的端侧操作能力提出了更高要求,也意味着“语音+Agent”正成为桌面生产力场景的一条重要技术路线。

行业内的竞争也在同步推进。Anthropic已为Claude引入新的语音模式,能够调用Opus、Sonnet、Haiku等模型,在Gmail、Calendar、Slack、Notion、Canva等主流办公应用中处理日常工作。语音交互正成为头部AI公司争夺办公与开发者生态的新焦点。

对用户/开发者/创作者的影响

对普通用户而言,语音控制电脑降低了操作门槛,尤其适合多任务并行场景,但涉及屏幕内容授权时仍需审慎评估隐私风险。对开发者来说,ChatGPT Voice与Codex的结合是最直接的变化:语音提交PR、创建代码线程、排查Bug等操作,可以缩短从意图到行动的路径,减少上下文切换成本。创作者则可以在素材整理、内容排版、应用操作等环节通过语音推进流程,但AI执行结果仍建议人工复核,尤其是涉及修改或删除操作时。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

目前公开信息显示,ChatGPT Voice对Windows桌面端的支持情况尚未明确,跨平台落地节奏值得观察。其次,Appshots授权的边界如何控制、用户能否按应用或按时间限定访问范围,将直接影响该功能在企业环境中的采用率。最后,Anthropic与OpenAI在语音Agent方向上的竞争是否会推动语音模型API进一步开放,也会影响开发者在第三方应用中的集成选择。

来源:AIbase

celebrityanime
celebrityanime
文章: 18313

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注