为什么AI还没有真正发现新的科学?普林斯顿王梦迪:答案可能不在模型里

普林斯顿大学王梦迪指出,当前大模型擅长给出概率分布中“最可能”的答案,却容易忽略真正新发现所在的长尾区域,因此AI尚未在物理、化学、生物等基础科学领域产生原创性突破。她认为关键不在模型规模,而在于能否建立让真实世界可验证的实验基础设施。

一句话看懂:普林斯顿大学王梦迪指出,当前大模型擅长给出概率分布中“最可能”的答案,却容易忽略真正新发现所在的长尾区域,因此AI尚未在物理、化学、生物等基础科学领域产生原创性突破。她认为关键不在模型规模,而在于能否建立让真实世界可验证的实验基础设施。

事件核心:发生了什么

2026年9月10日,在外滩大会主论坛上,普林斯顿大学AI创新中心主任王梦迪提出一个问题:AI距离自主发现新科学还有多远?她的判断是,今天的大模型已经掌握了海量人类知识,但在真正的科学发现上仍存在明显局限——模型更擅长找到“最可能”的答案,而真正的新发现往往位于概率分布的长尾部分。

王梦迪团队与普林斯顿社会学系谢宇教授合作开展了一项“模拟人生”实验,使用ChatGPT、Claude等大模型,让模型模拟一个1930年出生的英国人并自主生成其人生轨迹。实验发现,在结婚年龄、职业、性别等多个议题上,大模型倾向于高估最常见的情况,却显著低估少数群体和长尾分布。“模型学到的是概率分布中的最大似然点,但可能低估甚至忽略长尾中的知识,”王梦迪说。

她认为,这也解释了为什么大模型在数学和编程领域进步迅速,却在物理、化学、生物等基础科学领域尚未产生同等规模的原创发现。差异在于,数学和编程有相对明确的“验证器”:代码可通过编译器和单元测试验证,数学可用Lean等形式化证明系统。模型可以不断尝试、获得反馈、修正答案,再进入下一轮训练。但真实科研的验证要困难得多。

为什么重要

这一判断触及当前AI行业的一个核心议题:大模型的能力边界究竟在哪里。过去几年,行业普遍相信“更多数据、更大参数”会持续推动能力跃升,但王梦迪的观点提示,在科学发现这类任务上,瓶颈可能不在模型内部,而在外部验证环境。科研往往涉及复杂实验设备、人工判断和跨团队协作,许多实验无法稳定复现。信息更多,并不意味着真正有效的新信息在增加,反而可能降低研究过程中的“信噪比”。

这为AI在科研领域的商业化路径提供了另一种思路:与其继续堆算力、扩参数,不如投资可验证的实验基础设施。王梦迪团队正在尝试构建这样的设施——在量子材料研究中建立自动化实验平台,将原本需要研究人员数月完成的石墨烯实验流程自动化,并把实验设备和能力封装成API,供其他研究机构调用和复现。同时,他们还在探索面向研究实验室的智能操作系统LabOS,让多模态AI通过智能眼镜感知实验环境、辅助研究人员操作,并进一步连接软件、AI模型、机器人和真实实验设备。

对用户/开发者/创作者的影响

对开发者而言,这意味着单纯依赖大模型API做“科学发现类”应用,短期内可能难以达到预期效果。如果产品涉及科研辅助、实验设计或数据分析,需要把验证环节纳入系统设计,而不是只依赖模型输出。对科研机构和实验室来说,自动化实验平台和LabOS这类基础设施值得关注,它们可能改变实验数据的采集、复现和共享方式。对内容创作者和普通用户,这一讨论也有参考价值:AI生成的“标准答案”往往偏向主流和常见情况,在涉及少数群体、边缘案例或长尾知识时,需要保持审慎。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

目前公开信息显示,王梦迪团队的自动化实验平台和LabOS仍处于探索阶段。后续可观察三个方向:一是这类实验基础设施是否会开源或开放API,降低其他研究机构的接入门槛;二是是否有更多AI公司或科研机构跟进“可验证科研环境”这一路线;三是大模型在长尾分布上的偏差问题,是否会出现针对性的训练方法或评估基准。这些进展将决定AI是继续停留在“知识助手”角色,还是真正向“科学发现者”靠近。

来源:AIbase

celebrityanime
celebrityanime
文章: 22832

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注