Station智能体开放式科研重发现率62.7%,远超Codex与AI Scientist

arXiv 上一篇新论文提出在 Station 模拟科研生态中加入 Supervisor 与周期性 Meta Reflection 机制,让多智能体在无标准答案、无网络的环境下做开放式科研,平均重发现 ICLR 三篇 oral 论文 62.7% 的结论,而 Codex Multiagent-v2 和 AI S…

一句话看懂:arXiv 上一篇新论文提出在 Station 模拟科研生态中加入 Supervisor 与周期性 Meta Reflection 机制,让多智能体在无标准答案、无网络的环境下做开放式科研,平均重发现 ICLR 三篇 oral 论文 62.7% 的结论,而 Codex Multiagent-v2 和 AI Scientist-v2 仅约 15%。

事件核心:发生了什么

2026 年 10 月 8 日,arXiv cs.AI 发布论文《Can AI Agents Make Open-Ended Scientific Discovery? Evidence from Station》。研究基于 Station 这一开放世界环境,多个智能体在其中模拟科研生态。作者为其加入两个机制:Supervisor 负责监督与调度,周期性 Meta Reflection 在中间指标缺失时仍推动持续探索。

实验构造了三项开放式任务,取自 ICLR 近期三篇 oral 论文:只给智能体论文的核心研究问题,隐去结果并关闭网络访问,随后按细分标准统计智能体重发现了多少原始发现。结果显示,Station 平均重发现 62.7% 的标准;对比之下,Codex Multiagent-v2 为 15.4%,AI Scientist-v2 为 14.4%–20.6%。消融与行为分析表明,两个机制同时加入能提升研究覆盖度与连续性。作者还在两个没有对照论文的开放式任务上测试,发现智能体的部分发现与知识截止日期后研究者报告的结果接近。需要说明,以上均来自论文摘要,全文实验尚未核验。

为什么重要

过去 AI 做科研的进展多集中在指标明确的封闭任务,如蛋白质结构预测或数学证明。开放式科研没有清晰奖励信号,智能体容易中途放弃或反复打转。该研究把问题从“模型能力”扩展到“环境设计”:合适的监督与反思机制,可能让大模型智能体在缺乏中间指标时仍保持探索,这为多智能体系统、AI Scientist 类应用提供了一条可复制的工程路径。目前公开信息显示,其意义更多在于验证环境机制的有效性,而非宣告 AI 已能独立完成科研。

对用户/开发者/创作者的影响

对开发者而言,Supervisor 加 Meta Reflection 是可借鉴的编排思路:在长时间运行的智能体工作流中,加入周期性质疑与任务重规划,可能比单纯堆叠模型或算力更有效。对使用 AI 辅助研究、内容创作或数据分析的团队,这意味着下一阶段工具的重点会从“单轮推理”转向“长流程自主推进”,评估指标也应从准确率扩展到覆盖率与连续性。对企业采购者,若类似机制进入闭源 API 或开源智能体框架,长任务自动化的价值会明显上升,但需自行验证其在真实业务中的稳定性。目前尚无产品化版本公布。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是论文全文与复现细节,包括三项 ICLR 任务的具体选取标准和评分是否可重复;二是 Supervisor 与 Meta Reflection 能否被迁移到不同模型和开源框架,而不是仅在 Station 内有效;三是这一环境设计是否会被 Codex、AI Scientist 等系统跟进,形成新的多智能体科研基准。

来源:arXiv cs.AI

celebrityanime
celebrityanime
文章: 28181

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注