一句话看懂:9月2日,豆包工作台(Doubao Work)上线“多 Agents 并行”能力,并把“操作电脑”功能扩展到 Mac 系统。前者将复杂任务拆解给多个垂直子智能体同步执行,后者则通过 GUI 模拟点击与输入,让 AI 直接接管本地桌面,这是 AI 助手从聊天工具走向“能干活”的关键一步。
事件核心:发生了什么
据 AIbase 报道,豆包工作台在本周更新中正式推送了两项能力。第一项是“多 Agents 并行”:系统会由一个主智能体(组织者)对任务进行拆解,再把子任务分配给多个专业子智能体同步处理。官方给出的示例是筛选 70 份简历时,4 个子智能体可以并行各处理约 17 至 18 份;同时,不同子智能体还能在同一个复杂任务中承担差异化角色,分别产出 Word、PPT、HTML 等不同格式的结果。
第二项是“操作电脑”功能正式支持 Mac 系统。该功能不依赖 MCP、API、插件或 CLI,而是走 GUI(图形用户界面)路线,通过自动识别屏幕内容、模拟鼠标点击和键盘输入来完成操作。用户新建任务时勾选“操作电脑”技能或直接口述需求即可启用,操作过程中屏幕右下角会显示实时画面浮动窗口和蓝色虚拟光标。实际演示中,豆包成功完成了“预订周四轻食盒饭”的完整流程,包括切换品类、修正坐标偏移、滚动查找“金枪鱼沙拉意面”、确认取餐点并提交订单,全程展现了环境感知与自动纠错能力。
为什么重要
这两项更新放在一起看,指向的是 AI 助手产品形态的一个关键分叉。过去大模型厂商竞争的主线是推理能力和上下文长度,而这次豆包工作台把重心放在“任务执行层”——多 Agents 并行解决的是效率上限问题,让 AI 不再是一个单线程的对话窗口,而是能像团队一样把任务切碎同时推进;GUI 操作电脑则绕开了 API 生态不成熟的现实约束,让 AI 能直接接管用户日常使用的原生软件界面,这比等待每个软件厂商开放接口要快得多。
对行业而言,“操作电脑”不依赖 MCP 和 API 的技术选型尤其值得注意。它意味着 AI 助手的能力边界不再受第三方接口覆盖范围的制约,理论上任何可在屏幕上完成的操作都能被自动化。这也让豆包在办公场景中与依赖插件生态、云端 API 的同类产品形成差异化竞争,本地 GUI 路线在响应速度和隐私控制上也有潜在优势。
对用户/开发者/创作者的影响
对普通办公用户来说,多 Agents 并行的直接收益是批量任务处理时间明显缩短,尤其是简历筛选、资料整理、跨格式文档生成这类“琐碎但耗时”的工作。操作电脑功能落地 Mac 后,用户在本地软件间的搬运操作(如网页订餐、表格录入、文件归档)可以交给 AI 执行,且每个环节都有屏幕画面呈现,用户可随时介入打断,降低了失控风险。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
对开发者与企业 IT 团队而言,豆包选择 GUI 而非 API 路线意味着零接入成本——他们不需要为每个内部系统编写接口,AI 就能直接模拟人工操作现有工具,这尤其适合那些没有开放 API 的遗留业务系统。值得注意的是,AI 执行 GUI 操作时涉及权限授权和屏幕内容读取,企业内部部署时需要额外评估数据安全边界与账号权限管控。
对创作者和内容运营者,多子智能体并行产出不同格式内容的特性,可能改变过去“先出文字再转格式”的工作流,一次指令同时拿到文案、演示文稿和 H5 页面成为可能。
值得关注的后续
目前公开信息显示,豆包工作台承诺每周三更新新功能,有几个观察点值得跟踪。第一,“操作电脑”在 Mac 端的实际稳定性和复杂场景成功率——演示中的订餐流程相对简单,真实办公中频繁弹窗、网站改版、验证码等因素会大幅提高操作难度,模型能否持续保持纠错能力是产品口碑分水岭。第二,多 Agents 并行目前披露的是任务拆分调度逻辑,子智能体之间的上下文传递质量、输出一致性,以及并行数量上限是否会影响推理成本,这些问题尚未有公开数据支撑。第三,微软 Copilot、OpenAI 的 Agent 工具等竞品是否会跟进 GUI 本地操作路线,直接影响该功能的窗口期优势。
来源:AIbase


