Agent 论文一天能刷一打,缺的不是链接,是地图。 复旦团队这篇 86 页综述《The Rise and Potential of Large Language Model Based Agents》把清单开源了:脑子、感知、行动三块怎么拼,单智能体、多智能体、人机协作往哪走,社会模拟踩过哪些坑。 必读单就挂在这个仓库里。 1⃣ 按「脑 / 感知 / 行动」拆构造,不是一锅日期倒序 2⃣ 记忆、推理、规划、工具、具身分开列 3⃣ 单…

复旦团队发布了一篇 86 页的 LLM Agent 综述论文,并开源了配套的论文清单仓库,将散乱的海量研究按「脑 / 感知 / 行动」等维度重新整理,为开发者提供了一张可检索的技术地图。

一句话看懂:复旦团队发布了一篇 86 页的 LLM Agent 综述论文,并开源了配套的论文清单仓库,将散乱的海量研究按「脑 / 感知 / 行动」等维度重新整理,为开发者提供了一张可检索的技术地图。

事件核心:发生了什么

复旦大学团队于近期发布长篇综述《The Rise and Potential of Large Language Model Based Agents》,论文编号 arXiv:2309.07864,全文共 86 页。与一般按时间顺序罗列论文的综述不同,这篇工作将大模型 Agent 的研究拆解为「大脑、感知、行动」三大核心模块,并分别对记忆、推理、规划、工具使用、具身能力等子方向做了独立梳理。此外,论文还区分了单智能体、多智能体协作与人机协同三种落地范式,并将行为建模、人格设定、沙盒社会模拟等内容单独成章,Benchmark、训练策略与强化学习相关的工作也被归类为独立栏目。配套的仓库 GitHub 上同步开源了按上述结构整理的必读论文清单。后续该团队还推出了 AgentGym 与 AgentGym-RL 等相关项目。

为什么重要

当前 LLM Agent 领域的论文发布速度极快,研究者与开发者普遍面临「链接过剩、信息过载」的困境。像这种以「坐标系」而非「流水账」形式呈现的综述,能够显著降低入门者的认知负担。其意义不只在于总结,更在于提出了一个可复用的分类框架:把大脑的认知能力与身体的动作执行拆开审视,这实际上呼应了行业里从「对话模型」向「具身智能」和「复杂任务求解」演进的趋势。对于技术社区来说,这类结构化综述的存在,有助于减少重复性研究,也让 Agent 的能力边界与瓶颈(比如记忆机制、多智能体通信成本)更容易被识别。

对用户/开发者/创作者的影响

对开发者而言,这篇综述相当于一份按图索骥的索引,可以根据自己的场景(单 Agent 工具调用、多智能体协作、人机交互界面)快速进入对应分支,找到值得精读的代表性工作,而不是在社交媒体时间线上刷到哪篇读哪篇。对创作者或研究者来说,论文中专门整理的沙盒社会模拟与人格行为章节,为思考 AI 角色扮演、虚拟社区产品提供了上游文献入口。对普通用户而言,目前公开信息显示这篇综述对产品使用方式没有直接影响,但其所梳理的 Agent 能力边界,可以作为判断各家 AI 产品宣传话术是否兑现有据的参考框架。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

第一,看这份仓库的维护频率,如果保持更新,它有望成为社区共同维护的 Agent 研究索引库,类似 Papers with Code 的定位;第二,关注 AgentGym 及 AgentGym-RL 项目是否发布正式版本或 API,这关系到训练框架能否被更多开发者实际使用;第三,观察是否有团队直接采用「脑 / 感知 / 行动」这套分类来设计新的 Agent 架构,一旦出现,说明这份综述的影响已经从文献整理延伸到了工程实践层面。

来源:@XAMTO_AI

celebrityanime
celebrityanime
文章: 21315

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注