一句话看懂:普林斯顿大学与英国AI安全研究院(AISI)用尚未公开的NeurIPS投稿做了一次“影子评测”,测试Claude Opus 4.8能否独立完成AI研究。结果两篇论文都被原作者以“Strong Reject”(强烈拒绝)级别否决,说明Anthropic和OpenAI宣称的“自主AI研究近在咫尺”并不成立。
事件核心:发生了什么
这项研究来自普林斯顿大学和英国AI安全研究院,核心方法是“影子评测”(Shadow Evaluation):拿两篇尚未发表的NeurIPS 2026投稿作为测试题,让AI智能体在六天、3000美元API预算和GPU配额下独立完成研究,再把结果交给原论文作者充当会议审稿人评判。因为论文结果未公开,AI无法依靠训练数据“背答案”。
测试选用了Claude Opus 4.8(Extra-High Reasoning模式),搭载了奥地利开发者Peter Steinberger开源的OpenClaw智能体框架。四天多的实验流程中,智能体会自行启动子任务、运行GPU任务,并在任务完成后被“心跳”机制唤醒继续工作。整个流程看起来非常接近一个自主研究助理。
但审稿结果毫不留情:两篇论文均被拒绝,其中一篇被评为“Strong Reject”。审稿人批评其数据动机不明确、实验设计“离奇”、推理存在“以例代证”的谬误,还有一篇正文没有任何配图——NeurIPS标准下属于会被直接撤稿的格式问题。分析智能体日志后发现,它在探索五到十小时后就会锁死技术方向,无法有效回退;遇到假设不成立时,只会收窄原有说法而不是另寻出路;对“什么值得发表”完全没有判断力。两个任务的API预算分别只花掉不到一半,说明问题不在算力或成本,而是模型没有研究品味和批判性思维。
为什么重要
Anthropic和OpenAI曾多次释放信号,称模型正在加速AI研究本身,暗示“AI科学家”很快会成为研发现实。这项交叉验证给出了重要的反驳证据:AI智能体可以执行研究工程——跑实验、写代码、调参数——但科学研究中最本质的部分,即提出有价值的问题、设计可靠的对照实验、判断结果是否值得发表,仍然是当前大语言模型无法跨越的瓶颈。
这实际上指出了自动化研究“自欺”的风险:如果企业只用内部数据自我评估,AI生成的研究报告可能会呈现“看起来很科学但不成立”的状态。另一个值得注意的细节是Meta AI近期描述的“行为状态衰减”现象(智能体在长上下文中逐步遗忘明确要求)也在这项测试中反复出现,说明这不是单一实验室的偶发问题,而是长时程自主代理的普遍短板。
对用户/开发者/创作者的影响
对开发者来说,本次测试给出了明确的智能体能力边界:把执行链路交给AI工作流是可行的,但把研究设计、结论评估这类产出质量职责也交给AI,目前会得到被同行直接否决的结果。这对所有基于智能体做技术选型或R&D预算规划的团队都是一个参考底线。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
对使用AI做内容创作和图像、视频生成的创作者也有启示:AI擅长产出“看似完备、实则空洞”的中间物,它自己无法识别质量缺陷,你需要一个真正懂行的人在最终环节把关,而“懂行”恰恰是当前自动化链条中最无法替换的部分。
值得关注的后续
其一,这次测试只用了一个模型和两个任务,样本量有限,且目前公开信息显示该研究以论文形式发布,尚未经过完整的正式评审;后续若Anthropic或OpenAI针对这次评测做出回应,或拿出更强模型(如OpenAI的下一代推理模型)的复测结果,会比任何宣传口径都更有说服力。
其二,OpenClaw这类开源智能体框架是否会针对“早停”和“指令漂移”加入反馈机制,比如强制延展探索时间或让独立审查者介入,值得开发者关注。
其三,这项研究指向一个更冷静的路线图:企业如果真想用AI推进科研,优先方向也许是“人机协作研究”而非“全自主研究”——把探索性工作与质量把关分开,而不是追求一个端到端的自动科学家。


