AI 递归自我改进也许终究不会来得那么快(2026年8月)

普林斯顿大学等机构的一项新研究发现,AI 智能体虽然能完成 AI 研究中的工程任务,却写不出达到顶会接收水平的研究论文。这给“AI 很快能递归自我改进”的乐观预期泼了一盆冷水。

一句话看懂:普林斯顿大学等机构的一项新研究发现,AI 智能体虽然能完成 AI 研究中的工程任务,却写不出达到顶会接收水平的研究论文。这给“AI 很快能递归自我改进”的乐观预期泼了一盆冷水。

事件核心:发生了什么

这项研究由普林斯顿大学的 Peter Kirgis 和 Sayash Kapoor 领衔,联合多所机构完成。团队提出了一种叫“影子评估”(shadow evaluation)的新方法:让 AI 回答两篇尚未公开、已投稿至 NeurIPS 2026 的论文所研究的问题,因为论文未公开,智能体无法从训练数据中背答案,也无法在网上搜到。

受测的是 Anthropic 的 Claude Opus 4.8,运行在开源软件 OpenClaw 上。研究者给了它六天时间、3000 美元 Anthropic API 额度、GPU 算力、独立虚拟电脑和开放网络访问权限,目标是产出一篇够格发在顶级 AI 会议上的论文。原作者按会议评审标准打分——两篇都被拒了。

结论很直接:智能体把文献综述、数百次实验、结果汇总这些工程活儿都干了,但研究本身“明确地做得很差”,做了奇怪的小样本合成数据实验,写得难以理解,也没带来任何新贡献。它们不够探索不同思路,过早锁定没前途的方向,也无法从失败路线中彻底回头。

为什么重要

AI 递归自我改进,指的是 AI 几乎不需要人类监督就能改进自身。这是当前行业最激进也最吸引资本的叙事之一,而它成立的前提,是 AI 能做开放式研究——那种没有标准答案、需要判断力和品味的自由探索。

这项研究指出,现有评估大多只测“有可检验答案的窄任务”,比如解工程题或按基准微调小模型,忽略了开放式思维。换句话说,一些“自动化 AI 研究”的时间表可能跑在了证据前面。这不代表路线错了,但意味着从“能跑实验”到“能提出问题并判断证据”,中间隔着一道尚未跨过的坎。

对用户/开发者/创作者的影响

对开发者和 AI 应用团队来说,短期内可以把智能体当成高效的工程执行层:跑实验、写代码、整理数据、做文献梳理,这些已经可用。但别急着把研究决策、方向取舍交给它。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对创业者和投资人,这条信息值得纳入判断:如果一家公司把“AI 自主做研究”当作核心卖点,需要追问它到底在评估什么能力。对企业采购,多智能体协作的可靠性仍是变量——研究中子智能体偶尔会幻觉或曲解结果,靠主控智能体才拦下来。

值得关注的后续

一是“影子评估”这类方法会不会被更多机构采用,成为衡量 AI 研究能力的标准。二是模型是否会在训练中专门补上判断力、创造力和资源管理这些短板。三是业界对“自动化 AI 研究”时间表的公开口径是否随之调整。

来源:Hacker News (黑客新闻)

celebrityanime
celebrityanime
文章: 23270

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注