构建VideoAgent风格的多Agent系统:视频编辑任务的意图解析、图形规划和工具路由

研究人员提出了一种名为VideoAgent的多Agent系统架构,专门用于复杂视频编辑任务。该系统通过意图解析、图形规划和工具路由三个模块分工协作,旨在将自然语言指令直接转化为精准的剪辑操作,解决了当前AI视频编辑工具难以理解深层需求的问题。

研究人员提出了一种名为VideoAgent的多Agent系统架构,专门用于复杂视频编辑任务。该系统通过意图解析、图形规划和工具路由三个模块分工协作,旨在将自然语言指令直接转化为精准的剪辑操作,解决了当前AI视频编辑工具难以理解深层需求的问题。

用户在 Dify 1.15.0 版本(Self Hosted Docker 部署)中创建了一个工作流:

7月13日,工信部等四部门联合发布指导意见,明确到2030年建成高效协作、智能互联的新型互联网基础设施,其中首次提出面向智能体(AI Agent)与智能体等场景,探索构建智能体互联网络基础设施。这意味着AI智能体将从单点应用走向网络化协同,有望解决当前智能体之间“各自为战”的碎片化问题。

2026年7月13日,工信部等四部门联合发布《关于推动互联网基础资源高质量发展的指导意见》,明确提出到2030年面向智能体与智能体、智能体与外部工具等场景,构建具备统一通信协议和数据交互标准的智能体互联网络基础设施。这意味着国家层面试图从底层规则入手,消除AI应用之间的“孤岛效应”,加速智能体从单点工具向网络…

北京市规自委密云分局副局长谢陨石自费购买10亿Token算力,利用腾讯WorkBuddy和CodeBuddy两款AI工具,在一个月内独立开发出一款名为“叫应”的防汛小程序,已在实战中大幅替代原先需要数十人通宵电话核对的防汛流程。

用户在 Open WebUI 中启用原生工具调用(Native/Server-Side Tool Calling),并开启流式聊天补全。用户与启用了工具的助手进行对话,助手在响应过程中多次调用 LLM(例如:LLM 返回工具调用 -> 执行工具 -> LLM 再次处理工具结果),最终仅显示一条可见的

在 Open WebUI 中集成 memos MCP server 后,用户触发 memos_search_memos 工具(查询参数为 ovh ),测试连接成功但实际搜索返回空结果。用户在任意浏览器中发起搜索请求均无返回。

字节跳动旗下豆包输入法正式面向华为HarmonyOS 5.0及以上系统开放内测招募,核心卖点是移植了豆包App同源的语音识别模型,并在内测阶段支持9键和26键两种主流键盘布局。这标志着字节跳动AI产品的跨平台生态布局,从Android、iOS、macOS延伸至华为鸿蒙原生系统。

浙江省省长刘捷专题调研集成电路产业,并明确将推动人工智能及算力、芯片、智能装备等产业高质量发展,意味着地方政策将进一步向AI基础硬件和产业链上游倾斜。

浪潮信息在2026开放计算大会上发布了两款产品——CPU原生液冷整机柜和元脑SD200超节点企业版,分别解决Agent规模化运行和多模型协同推理的问题。这标志着AI基础设施正从“支撑单一模型推理”转向“支撑海量智能体的持久化运行”。