哈佛物理学家用开源工具 BootLoops 配合 Claude 在三个月内完成跨 18 个学科的 36 份科学手稿,但结论须人工专家审核才能确保科学价值。
Harvard 物理学家 Matthew Schwartz 构建了 "BootLoops",这是一个利用语言模型进行精确科学计算的开源工具架,并在各学科之间搭建起知识桥梁。
三个月内,Schwartz 与 19 位合著者产出了横跨 18 个领域的 36 篇论文,涵盖粒子物理计算、生态建模和基因组分析。
Schwartz 警告说,这些模型往往过早宣告胜利,或从正确的计算中得出错误的结论,因此人类监督和验证仍然不可或缺。
自动化问题求解与相关研究是两码事。
这是哈佛大学物理学教授 Matthew Schwartz 在 Anthropic 客座文章中提出的核心观点。他描述了自己如何停止尝试让 Claude 像人类研究员那样工作,转而开始寻找"Claude 形状的问题"——即当今 AI 模型擅长的任务。Schwartz 目前也是 Anthropic 的访问研究员。
"Claude 形状的问题"位于科学家想要研究的内容与 AI 实际能做到的事情的交汇处。| 图片来源:Anthropic

这种方法催生了 BootLoops,一个用于精确科学计算的开源工具架。源代码已在 GitHub 上开放。
据 Schwartz 介绍,使用该工具架,Claude 发现了粒子物理、生态学、群体遗传学、经济学和语言学之间的联系。但这些结果往往只有在领域专家介入设定方向后,才具有科学价值。
Schwartz 用"凸包"(convex hull)概念来说明 AI 如何助力科学。人类知识是碎片化的,各个领域向不同方向延伸,而它们之间的空白却无人探索。一个实验室可能花 20 年用单一方法研究一组基因,留下邻近基因和替代方法无人触及。像 BootLoops 这样的 AI 工具架旨在通过在知识参差不齐的前沿之间建立联系来填补这些空白。
人类知识横跨各个学科,而它们之间的空白仍属未知。类似 BootLoops 的 AI 工具架旨在填补这些空白。| 图片来源:Anthropic

三个月内产出 18 个领域的 36 篇论文
三个月内,该团队在 18 个领域产出了 36 篇论文,作者共 19 人。Schwartz 从粒子物理计算入手,具体是散射振幅和椭圆积分。几周内,Claude 用 BootLoops 计算了 30 个积分,其中 15 个复现了已知结果,15 个首次被计算出来。
随后他将搜索扩展到其他领域。在生态学中,Claude 解决了一个中性生物多样性理论中 20 年来无法大规模计算的方程。当应用到数据时,结果表明巴拿马运河中的巴罗科罗拉多岛上树木物种组成的变迁速度比该理论所允许的快 4.5 倍。生态学家 James O'Dwyer 随后帮助将这一发现转化为更好的预测模型。
在群体遗传学中,团队分析了来自千人基因组计划(1000 Genomes Project)的 57 亿个突变对,找到了名为"基因转换"(gene conversion)机制的证据。其他项目还包括一个面向经济学期刊的 AI 数据编辑器,自动检查了 4,452 个复现包(已作为 NBER Working Paper 发表),以及一个覆盖 6,072 种语言的词重音数据库,由三位语言学家共同构建。
"Python for engineers 现在已经过时了"
Schwartz 描述了 AI 改变科学的速度有多快,以至于提前规划已几乎不可能。为什么还要申请为期三年的资助来支持一个 AI 模型可能一夜之间就能解决的计算?
培养博士生也成了一个悬而未决的问题。自他此前发表关于"Vibe Physics"的文章以来,这种感觉只有增无减。在某些领域如计算机科学,这种颠覆令人担忧。两年前,他还会把"Python for Engineers"课程称为"必不可少的",但今天它已经是"不必要的",因为 Claude 已经能处理这些任务。
构建机器学习模型来研究物理现象是 AI 现在能够接管另一个领域。即使对神经网络有深入了解,当 Claude 能按需实现当前 ML 研究成果时,回报也越来越有限。
"自己把每件事都看一遍"
Schwartz 还警告了模型的弱点。Claude 喜欢过早宣告胜利,"done, with one asterisk"这类表述往往意味着"根本没做完"。它对任务耗时的判断常常出错,且倾向于暴力计算而非找到更优雅的解法。自动化检查并不可靠,Claude 的结论可能在其计算正确的情况下仍然是错的。
除了可靠性问题,模型还偏向于老的、被大量引用的争议,而非真正的新问题。Schwartz 表示,这些项目还"消耗大量算力和 token"。
Schwartz 还认为,聚焦大数学问题和标题党是危险的。不切实际的期望可能让人忽视那些当下已经可行的生产性应用。真正的进步仍将建立在扎实的基础之上,只是速度更快。科学方法本身并未受到威胁,人类的引导和品味仍然不可或缺。
AI 新闻去 hype——人工筛选
订阅 THE DECODER,享受无广告阅读、每周 AI 通讯、每年六期的专属"AI Radar"前沿报告、完整档案访问权限以及评论区域。