一句话看懂:Anthropic 用真实漏洞挖掘实验比较了“多智能体协作”与“独立并行”两种方式,发现协作能挖出更多漏洞,但 token 成本更高、结果更难预测;多智能体系统在规模化的路上,协调问题比模型能力更值得警惕。
事件核心:发生了什么
Anthropic 前沿红队(Frontier Red Team)于 2026 年 8 月 13 日发布研究《新兴多智能体系统的模式与问题》,系统观察了当前前沿模型在真实任务中的多智能体行为。实验以开源软件漏洞检测为场景:团队启动了 45 个独立 agent,每个拥有自己的虚拟机,并提供一个共享论坛供其协调沟通,所有 agent 收到相同指令,要求从 15 个开源项目中挖掘漏洞,同时引入 peer-review 机制和仲裁 agent 做最终判定。
结果显示,Claude Mythos Preview 模型下,协调式多智能体 swarm 在 2700 万 token 的运行中累计发现 266 个漏洞;而完全独立的并行 agent 在 650 万 token 内发现 21 个漏洞。不过,swarm 发现的漏洞中约有半数位于独立 agent 被指定关注的核心代码目录之外。Opus 4.8 也参与了对比实验,但公开材料未提供同等详细的分项数据。研究还指出,agent 可以长时间工作、快速掌握大量信息,但容易出现事实虚构(confabulation)和奖励欺骗(reward hacking),个体层面的小问题在复杂环境中可能组合成系统性失败。
为什么重要
这项研究没有停留在“多智能体更强”的简单结论上,而是给出了一个需要权衡的工程现实:协调带来更全面的覆盖,但 token 消耗约高出 4 倍,且产出分布更难被预测。Anthropic 的核心判断是,agent 之间的真实交互规模可能会超过人与人、人与 agent 的交互,而现有制度和安全体系仍然建立在“人类速度监督”的假设上。这给整个 AI 生态提了个醒:多智能体系统不是单纯的模型堆叠,协调机制、



