相比于语言大模型,语音大模型的发展要落后很多,但语音的作用不仅仅是多了一种交互方式,也是一个感知世界都触角。

阿里开源了实时语音交互框架 Qwen-Audio-Agent,让 OpenCode、OpenClaw、Codex 这类 AI Agent 获得“耳朵和嘴巴”,用户可以用类似打电话的方式与 Agent 实时协作。这个动作把语音大模型的竞争从“对话效果”拉回“干活效率”的层面。

一句话看懂:阿里开源了实时语音交互框架 Qwen-Audio-Agent,让 OpenCode、OpenClaw、Codex 这类 AI Agent 获得“耳朵和嘴巴”,用户可以用类似打电话的方式与 Agent 实时协作。这个动作把语音大模型的竞争从“对话效果”拉回“干活效率”的层面。

事件核心:发生了什么

7 月 30 日,AIGCLINK 在 X 平台转发了阿里开源 Qwen-Audio-Agent 的消息。这个项目不是一个全新的语音大模型,而是一个“实时语音 Harness”——作用是给已有的 Agent 工具加上实时语音输入输出能力。原帖作者 @koffuxu 的观点是:语音大模型的发展比语言大模型落后很多,但语音不仅是多了一种交互方式,也是感知世界的触角。另一名用户评论称,“语音一接上,Agent 的协作感会强很多”,这也是这个项目最直观的卖点。

为什么重要

长期来看,语音大模型一直处于“能对话但干不了活”的阶段。Qwen-Audio-Agent 的价值在于把语音能力和 Agent 的工具链接通,让语音直接参与任务执行。文字交互需要用户反复输入、确认、等待;实时语音则允许用户在没有键盘的场景下边想边说,Agent 边听边做。对行业来说,这个开源动作延续了阿里 Qwen 系列一贯的开源策略,意味着开发者不必从零训练语音模型,就能为现有 Agent 框架接入实时语音能力,这会明显降低语音 Agent 的开发门槛。

对用户/开发者/创作者的影响

对开发者而言,最直接的价值是在 OpenCode、Codex 等开源 Agent 工具上集成实时语音,让产品从“命令行协作”升级为“像打电话一样协作”。对普通用户,未来调试代码、操作自动化工具的门槛会下降,语音可能替代一部分键盘输入。对创作者和办公场景,语音交互能释放双手,适合边口述边让 Agent 处理文档、脚本或数据。目前公开信息显示,Qwen-Audio-Agent 已经开源,但底层模型的识别效果、响应延迟以及具体接入成本,还需要开发者实际测试后才能判断。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是 Qwen-Audio-Agent 是否会在 GitHub 正式建立

celebrityanime
celebrityanime
文章: 16357

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注