多智能体在投研里加人不等于加效果。论文里最好的模型任务成功率只有52%,真正对最终结果有用的动作不到三分之一,剩下大多是重复劳动、信息没对齐或者计划中途丢了。 投研常见的做法是让几个agent分别看财报、新闻、行业数据和估值,再拼成一份报告。一旦角色分不清、共享的假设和中间结论不稳定,就会出现重复挖同一段数据、关键数字互相打架、最后结论对不上的情况,协调本身就把省下的时间吃掉了。 实际更稳的做法是先把单点做扎实,比如数据抽取、交叉校验…

多智能体系统在投研场景里并不是“加人越多效果越好”,AgentWorld 论文显示最好的模型任务成功率仅 52%,真正推进任务的动作不到三分之一。值得关注的是,协调本身正在吃掉多智能体省下的时间。

一句话看懂:多智能体系统在投研场景里并不是“加人越多效果越好”,AgentWorld 论文显示最好的模型任务成功率仅 52%,真正推进任务的动作不到三分之一。值得关注的是,协调本身正在吃掉多智能体省下的时间。

事件核心:发生了什么

投资人 Martin(@gangtiser)引用了 AgentWorld 论文的结论:当一个多智能体团队由 3 到 20 个 agent 组成时,真正对最终结果有贡献的动作不到三分之一,其余大多是重复劳动、信息没对齐或计划中途丢失。论文中表现最好的模型,任务成功率也只有 52%。

这和投研里常见的做法直接相关:让几个 agent 分别看财报、新闻、行业数据和估值,再拼成一份报告。角色分不清、共享假设和中间结论不稳定时,就会出现重复挖同一段数据、关键数字互相打架、最终结论对不上的情况。协调成本,往往把多智能体本该省下的时间抵消掉了。

为什么重要

这给多智能体热泼了一盆冷水。眼下不少 AI 应用和 API 编排框架都在强调“多 agent 协作”,但从这项研究看,agent 数量和任务成功率之间并不成正比。真正稀缺的不是更多角色,而是稳定的状态共享、可追溯的假设跟踪和清晰的计划对齐。对做 AI 应用的团队来说,这意味着单纯堆 agent 可能带来更高的推理成本和更差的可靠性,而不是更强的结果。

对用户/开发者/创作者的影响

对开发者,优先把单点能力做扎实更划算:数据抽取、交叉校验、假设跟踪这类基础模块,比再加一个 agent 更能提升最终质量。对用 AI 做投研或内容创作的用户,遇到“多 agent 报告”产品时,可以追问它怎么处理冲突数字、怎么保持中间结论一致,而不是只看它有几个 agent。对企业采购,也要把协调开销和失败率算进成本,避免为重复劳动买单。目前公开信息显示,这类系统的可靠性仍在早期阶段。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是看 AgentWorld 后续是否公布更细的任务类型与失败原因拆分;二是看主流 agent 编排框架会不会把共享状态、计划对齐做成一等能力;三是看投研类 AI 产品是否从“堆 agent”转向“少而稳、单点扎实”的路线。

来源:@gangtiser

celebrityanime
celebrityanime
文章: 26878

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注