ChatGPT 桌面端装上了”真人口吻”:GPT-Live 语音上线,你说话它就在后台干活

OpenAI 于 7 月 24 日为 ChatGPT 桌面应用正式上线了基于 GPT-Live 模型的语音模式,用户可以在 Chat、Work 和 Codex 三个板块中用语音启动任务、检查进度。这不仅是语音输入,而是实现了全双工对话——AI 能一边听、一边说、一边在后台执行多线程任务,显著提升了人机协作的流…

ChatGPT 桌面端装上了

一句话看懂:OpenAI 于 7 月 24 日为 ChatGPT 桌面应用正式上线了基于 GPT-Live 模型的语音模式,用户可以在 Chat、Work 和 Codex 三个板块中用语音启动任务、检查进度。这不仅是语音输入,而是实现了全双工对话——AI 能一边听、一边说、一边在后台执行多线程任务,显著提升了人机协作的流畅度。

事件核心:发生了什么

OpenAI 对集成 Codex 后的 ChatGPT 桌面客户端进行了重大升级:新推出的 ChatGPT Voice 模式基于最新 GPT-Live 模型,实现了全双工(full-duplex)语音交互能力。这意味着 AI 能够同时接收和输出语音,不再需要用户等待它“说完再问”,对话节奏更接近真人交谈。

具体功能上,用户可以直接通过语音在三个工作区(聊天、任务、Codex 编程环境)发起任务、查询进度或调整指令。例如,用户可以在说话的同时启动多个工作流,智能代理会在后台默默完成任务,用户无需停下对话等待。OpenAI 给出的典型场景是出差规划:你让 ChatGPT 检查日历冲突、扫描邮件找航班变更、准备会议纪要,这些任务全在你喝咖啡或做其他事时并行完成。该功能的研发始于 2024 年的 ChatGPT 语音识别,经过多轮技术迭代,最终以 GPT-Live 模型形态落地。

为什么重要

这一更新将语音交互从“替代键盘输入的输入法”升级为“与后台执行系统绑定的会话引擎”。此前多数语音助手只能处理单线程问答,而 GPT-Live 的多任务并行的能力,实际上将大模型从“对话工具”推向“个人任务调度中枢”。对 OpenAI 而言,这强化了 ChatGPT 桌面端在办公和开发场景中的粘性,特别是与 Codex 的结合,使得开发者可以用自然语言语音驱动 IDE 级别的任务。在竞争层面,这直接拉高了对话式 AI 的产品门槛——不再是模型能力竞赛,而是端到端的交互体验、后台任务编排、实时响应延迟的综合比拼。

对用户/开发者/创作者的影响

普通用户:日常使用体验质变,复杂任务(如旅行规划、会议准备、跨应用操作)可以在不打断对话的背景下完成,效率明显提升。需要注意的是该功能目前仅限桌面端,且对网络实时传输质量有一定要求。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

开发者:通过 Codex 板块中的语音接口,开发者可以用口语描述需求,让 AI 在后台编写代码、调试、运行并返回结果。这降低了编程门槛,但也对团队如何协作和审查 AI 生成代码提出了新的管理问题。

创作者与策划人员:在构思和迭代阶段,可以快速用语音触发文档整理、资料检索、大纲生成等多步骤任务,无需在多个窗口间反复切换。

值得关注的后续

第一,GPT-Live 模式的收费策略:目前该更新已纳入现有 ChatGPT Plus 和 Team 套餐,但未来是否会像 GPT-4o 的某些高级功能一样单独计费,官方尚未明确。第二,移动端适配时间表:桌面端率先上线,移动端何时集成全双工语音是用户关注的焦点。第三,竞品动作:谷歌 Gemini 和 Anthropic Claude 均已展示过语音交互原型,OpenAI 这次正式上线将迫使对手加速产品迭代,尤其是端侧低延迟推理能力的竞争。

来源:AIbase

celebrityanime
celebrityanime
文章: 15035

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注