首发!openJiuwen workSwarm全双工多模态 ,像聊天一样与Agent交互,昇腾算力原生亲和

openJiuwen 开源工作台 WorkSwarm 发布全双工多模态能力,让用户能像打电话一样随时打断 AI,同时把查资料、调工具等耗时任务交给后台 Core Agent 并行处理。它把"对话不中断、任务不停跑"从演示推向了可安装使用。

一句话看懂:openJiuwen 开源工作台 WorkSwarm 发布全双工多模态能力,让用户能像打电话一样随时打断 AI,同时把查资料、调工具等耗时任务交给后台 Core Agent 并行处理。它把”对话不中断、任务不停跑”从演示推向了可安装使用。

事件核心:发生了什么

openJiuwen 是由华为 2012 实验室、华为云、终端、计算等团队联合高校与企业开发者构建的开源 AI Agent 平台,此次其开源办公编码工作台 WorkSwarm 推出全双工多模态能力。核心机制是把交互拆成两条路径:实时模型负责看画面、听指令、即时回应;Core Agent 负责拆解任务、调用工具、生成文件产物。两者共用同一个任务上下文,但运行状态彼此独立。

具体表现上,用户可在 AI 播报时插话,系统检测到有效人声后停止当前播报并转入新指令,已生成文字仍保留在任务记录中;后台任务进入队列后,用户可调整顺序、置顶或手动停止。目前 openJiuwen 已提供 Windows、Mac、HarmonyOS 一键安装包,并支持 Qwen Omni realtime websocket 与 JoyAI(ASR+LLM+TTS)协议接入,也可在华为云 ModelArts 上基于 vLLM-Omni 框架在昇腾 NPU 部署多模态模型。

为什么重要

此前多数语音助手仍是”对讲机”模式,用户必须等 AI 说完。把后台工具调用塞进实时交互,是 Gemini Live 等产品近期验证的方向,但工程难点在于对话层与任务层的状态隔离——插话要能打断播报,却不能误杀已经跑起来的工具任务。WorkSwarm 用任务队列把这两件事分开管理,并让音视频连接与工具执行解耦,关闭视频后任务仍可继续。对开源 Agent 生态而言,这意味着全双工多模态不再只是闭源大厂的能力,而是有了可本地部署、可换模型的实现路径,昇腾算力原生亲和也给了国产 NPU 一个具体的落地场景。

对用户/开发者/创作者的影响

普通用户得到的直接变化是等待感压缩:汇报工作时 AI 会先出文字总结,等这一轮对话结束再语音播报重点,而非全部朗读。开发者可通过配置切换实时模型通道,或把 ASR、LLM、TTS 分拆接入不同平台的 API,降低了被单一模型绑定的风险。创作者在拍摄、走动等场景下,可以边展示画面边交代任务,再把整理文档、查资料等后续工作交给后台,事后回来查看文件产物。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是任务队列的实际调度精度,多任务冲突时插话是否会丢失上下文;二是昇腾 NPU 部署全双工模型的推理延迟与成本,这决定本地化方案是否具备性价比;三是开源协议与工具调用生态能否吸引足够多的第三方 Agent 接入。目前公开信息显示,该能力已可下载体验,但长期稳定性与多模态并发上限仍待观察。

来源:InfoQ CN

celebrityanime
celebrityanime
文章: 26432

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注