RSI-Forge 把210篇论文变成AI可执行任务,模型三次尝试后成绩显著提升

alphaXiv 上的一篇论文提出 RSI-Forge 多智能体流程,把已发表论文转换为带自动评测器的可执行环境;在 120 个环境中,四个模型连续三次尝试后,至少一个模型在 84% 的环境中取得提升。

一句话看懂:alphaXiv 上的一篇论文提出 RSI-Forge 多智能体流程,把已发表论文转换为带自动评测器的可执行环境;在 120 个环境中,四个模型连续三次尝试后,至少一个模型在 84% 的环境中取得提升。

事件核心:发生了什么

根据 alphaXiv 页面显示的论文信息,RSI-Forge 是一套多智能体流水线:作者智能体负责把论文改造成可运行任务,并准备起始代码、数据生成代码、评测器、开发集和留出测试集;复现智能体在不接触作者实现的情况下独立复现论文方法,作为基线;审查智能体负责检查任务说明是否可用、评测器是否衡量既定目标,失败时返回修复。最终产出覆盖 18 个领域的 210 个环境,其中 90 个由独立人类领域专家审查。原始素材称,从 10800 篇预印本中筛选出 2117 篇合格论文,79% 被接受的主运行环境至少经历一次修订。研究团队另在 120 个环境中让四个模型(Claude Opus 5、GPT-5.6-sol、DeepSeek、Claude Haiku 4.5)连续尝试三次,每次继承前一次代码与笔记,但模型权重保持不变。

为什么重要

可执行、可评测的研究环境一直是训练和评估“自我改进”智能体的稀缺资源。RSI-Forge 的价值在于把构建这类环境的流程部分自动化:用多智能体分工替代大量专家与工程投入,并通过审查与修复环节降低一次性生成带来的质量风险。论文同时强调,模型提升只发生在这些被改造过的任务上,任务经过算力约束适配,并不代表模型解决了原始科研问题,也不等价于真正意义上的自我改进。目前公开信息显示,专家评审对“改进起始方案的空间”和“评测器区分质量的能力”评分较高,但对捷径抵抗、忠实于源论文、单一思路能否穷尽任务更为挑剔。

对用户/开发者/创作者的影响

对开发者和研究者来说,这类工作可能降低构建 AI 评测基准与训练环境的门槛,未来或可复用于模型后训练、Agent 基准测试和自动化科研实验。但需要区分“环境生成”与“产品上线”:目前没有信息表明 RSI-Forge 已成为可直接调用的 API 或开源工具。对 AI 应用团队而言,更现实的启发是:评测器质量、开发集与留出集分离、独立复现基线,这些工程约束对构建可复现的智能体评测同样关键。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

第一,RSI-Forge 是否会开源或提供公开可访问的环境集合,让社区验证这 210 个任务的实际可用性。第二,后续研究能否证明提升来自继承的代码与笔记,而非单纯增加求解时间——这是判断“递归自我改进”叙事是否成立的关键。第三,该流程能否扩展到更依赖真实实验、硬件或长周期反馈的学科,而非停留在可被自动评测的计算型任务。第四,是否会出现同类竞品,把论文到任务的转换做成标准化基准平台。

来源:alphaXiv

celebrityanime
celebrityanime
文章: 28503

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注