开源“BootLoops”测试框架支持 AI 模型执行精确科学计算

哈佛物理学家 Matthew Schwartz 开发了开源工具 BootLoops,让 Claude 等大模型能够执行精确的科学计算;三个月内,团队在 18 个领域产出 36 篇论文手稿,但作者强调模型常过早宣布成功,人工验证仍不可替代。

一句话看懂:哈佛物理学家 Matthew Schwartz 开发了开源工具 BootLoops,让 Claude 等大模型能够执行精确的科学计算;三个月内,团队在 18 个领域产出 36 篇论文手稿,但作者强调模型常过早宣布成功,人工验证仍不可替代。

事件核心:发生了什么

Schwartz 目前是 Anthropic 的访问研究员。他放弃把 Claude 当作人类研究员使用,转而寻找“Claude 形状的问题”,即契合当前模型能力的计算任务,由此构建了开源 harness 工具 BootLoops,代码已托管在 GitHub。

据公开信息,三个月内他与 19 位合著者在 18 个领域完成 36 篇论文手稿。起步于粒子物理的散射振幅与椭圆积分,Claude 在数周内算了 30 个积分,其中 15 个复现已知结果,15 个属首次计算。随后扩展到生态学、群体遗传学、经济学和语言学:解决了中性生物多样性理论中一个搁置 20 年的方程;分析了“1000 基因组计划”中 57 亿对突变;为经济学期刊自动核查了 4452 个复现包;还联合三位语言学家搭建了覆盖 6072 种语言的词重音数据库。

为什么重要

这条新闻的价值不在“AI 又能写论文”,而在于它给大模型的科研定位划了一条务实边界。Schwartz 用“凸包”比喻人类知识:各学科向外延伸,学科之间的空白长期无人填补。BootLoops 的意义是让模型跨越这些碎片化前沿,做精确计算和连接,而非替代研究判断。

对行业来说,这意味着“AI 科研助手”的竞争点正从聊天能力转向可验证的精确计算与工具链。开源 harness 加上通用大模型,可能比封闭科研平台更快扩散。同时,作者本人的警告同样关键:模型会过早宣布胜利,用“完成了,但有一个星号”掩盖没做完,倾向暴力计算而非优雅解法,甚至计算正确但结论错误。自动检查不可靠,领域专家的介入是结果产生科学价值的前提。

对用户/开发者/创作者的影响

对科研和工程开发者,BootLoops 提供了一个可复用的思路:不要指望模型自主研究,而是把任务拆成适合模型的计算形状,再用人工和领域知识做验证闭环。Schwartz 提到,两年前还属“必修”的“工程师 Python 课”如今已显多余,训练 ML 模型研究物理现象也可能被 Claude 接管,博士培养模式因此需要重新思考。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对普通用户和内容创作者,这更像一个信号:大模型在高精度、可校验任务上的可用性在提升,但“AI 给出结论”仍不等同于“结论成立”,涉及数据、公式和事实的内容仍需人工复核。

值得关注的后续

目前公开信息显示,可观察点有三个:一是 BootLoops 在 GitHub 上的采用情况,是否形成社区维护的计算工具生态;二是模型厂商是否会针对精确科学计算优化推理与验证能力;三是这 36 篇手稿中哪些能通过同行评审并正式发表,这是检验“AI 辅助科研”成色的关键指标。

来源:The Decoder AI News

celebrityanime
celebrityanime
文章: 27096

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注