AI可以同时试错一万次,可能比科学家更敢挑战共识 虽然我们会担心,大语言模型擅长重组知识,却未必会像爱因斯坦那样,对现有理论产生不满并创立新的框架。 这个问题把保守理解成认知局限。但现实中的科学家是否挑战共识,还取决于能否承担失败。科研职业建立在经费、论文和同行认可之上。一个年轻研究者把数年投入非主流方向,失败可能影响毕业、职位和下一轮经费。选择更容易成功和发表的课题,往往是制度下的理性决定。 Honglin Bao、Siyang W…

一项针对12万篇论文的大规模研究发现,大语言模型和人类科学家一样倾向保守,但AI可以并行试错上万次,真正制约它挑战科学共识的,不是缺少灵感,而是科研体系愿不愿意为低概率方向持续付费。

一句话看懂:一项针对12万篇论文的大规模研究发现,大语言模型和人类科学家一样倾向保守,但AI可以并行试错上万次,真正制约它挑战科学共识的,不是缺少灵感,而是科研体系愿不愿意为低概率方向持续付费。

事件核心:发生了什么

芝加哥大学研究团队(包括Honglin Bao、Siyang Wu等)分析了121,640篇预印本,让26个大语言模型基于论文提出后续假设,并请6,749名论文作者完成了25,139组评价。结果显示:普通模型的想法容易趋同,推理模型探索范围更广,但很少主动提出“零假设”——即质疑某种被普遍相信的效应可能并不存在。人类科学家同样表现出风险厌恶,更愿意采纳成功概率较高、与自己研究相似的想法,新颖性的重要程度反而较低。

研究者还提出一个思想实验:如果把1905年之前人类拥有的全部科学数据交给AI,它能否推导出狭义相对论?这个被称为“科学图灵测试”的设想,来自法国Inria研究员Emmanuel Jeannot的讨论,指向一个根本问题——AI到底是在重组知识,还是能真正突破既有框架。

为什么重要

这项研究揭示了AI“保守”的深层原因:模型和人类的保守可能来自同一个知识生产体系。公开文献主要记录成功结果,失败实验、被否决的猜想很少进入训练数据;再用同行偏好训练评价模型,人类对失败的谨慎便被写进机器的目标。换句话说,AI不是天生缺乏创造力,而是在数据和评价机制上就被塑造成了风险规避者。

AI真正改变的是试错成本。人类一生只能认真追踪有限的问题,AI却能并行保留大量低概率方向,先通过计算和模拟完成筛选。每个假设都像一份成本有限的期权,多数最终归零,少数突破足以覆盖整个组合的投入。决定AI是否敢于挑战共识的,不再是“有没有灵感”,而是科研机构怎样分配风险预算。

对用户/开发者/创作者的影响

科研人员在使用AI辅助提出假设时,需要有意识地补充外部评价机制——目前公开信息显示,现成模型很少主动挑战主流结论,更适合用来帮助研究员扩展验证范围,而不是替代研究者的学术判断。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

开发者和模型训练者可以关注训练数据构成:如果希望让模型输出更多“反常”假设,可能需要专门引入失败案例、反证数据,并在偏好对齐阶段调整对新颖性的权重,而不是只用传统论文做强化学习。

AI内容创作者则可以利用大模型低成本生成多种不同方向的假设文本,但要记得,模型默认输出偏向安全区间,若需要真正的“脑洞”,要通过提示工程明确要求它考虑被否定或非主流的方向。

值得关注的后续

“科学图灵测试”目前更多是思想实验,尚未有公开的完整实现结果,但值得观察:推理模型是否会经过专门的“反证训练”,从而主动提出零假设;如果科研评价体系开始奖励可复现的失败,AI辅助研究是否会走向更激进的探索路线;以及当算力成本下降后,机构是否会愿意为低概率方向的批量试错保留资源——这可能是下一个影响AI科研生态的关键变量。

来源:@Acai_murmur

celebrityanime
celebrityanime
文章: 16661

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注