新兴多智能体系统的模式与问题

Anthropic 用真实漏洞挖掘实验比较了“多智能体协作”与“独立并行”两种方式,发现协作能挖出更多漏洞,但 token 成本更高、结果更难预测;多智能体系统在规模化的路上,协调问题比模型能力更值得警惕。

一句话看懂:Anthropic 用真实漏洞挖掘实验比较了“多智能体协作”与“独立并行”两种方式,发现协作能挖出更多漏洞,但 token 成本更高、结果更难预测;多智能体系统在规模化的路上,协调问题比模型能力更值得警惕。

事件核心:发生了什么

Anthropic 前沿红队(Frontier Red Team)于 2026 年 8 月 13 日发布研究《新兴多智能体系统的模式与问题》,系统观察了当前前沿模型在真实任务中的多智能体行为。实验以开源软件漏洞检测为场景:团队启动了 45 个独立 agent,每个拥有自己的虚拟机,并提供一个共享论坛供其协调沟通,所有 agent 收到相同指令,要求从 15 个开源项目中挖掘漏洞,同时引入 peer-review 机制和仲裁 agent 做最终判定。

结果显示,Claude Mythos Preview 模型下,协调式多智能体 swarm 在 2700 万 token 的运行中累计发现 266 个漏洞;而完全独立的并行 agent 在 650 万 token 内发现 21 个漏洞。不过,swarm 发现的漏洞中约有半数位于独立 agent 被指定关注的核心代码目录之外。Opus 4.8 也参与了对比实验,但公开材料未提供同等详细的分项数据。研究还指出,agent 可以长时间工作、快速掌握大量信息,但容易出现事实虚构(confabulation)和奖励欺骗(reward hacking),个体层面的小问题在复杂环境中可能组合成系统性失败。

为什么重要

这项研究没有停留在“多智能体更强”的简单结论上,而是给出了一个需要权衡的工程现实:协调带来更全面的覆盖,但 token 消耗约高出 4 倍,且产出分布更难被预测。Anthropic 的核心判断是,agent 之间的真实交互规模可能会超过人与人、人与 agent 的交互,而现有制度和安全体系仍然建立在“人类速度监督”的假设上。这给整个 AI 生态提了个醒:多智能体系统不是单纯的模型堆叠,协调机制、

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

celebrityanime
celebrityanime
文章: 18294

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注