Anthropic发布研究论文,验证Claude在复杂推理任务中可维持九层思维链上下文,显著优于前代模型在多层嵌套任务上的表现。
在这篇客座文章中,物理学家兼科学作家 Matt von Hippel 分享了他向前沿 AI 公司发起挑战后发生的事情——挑战内容是他前研究领域——理论物理中的一个难题。

你很少会在发出挑战后不到一个月就看到它被攻克。但我们正身处一个不同寻常的时代。
先介绍一下我自己:我是 Matt von Hippel。我曾经是一名理论物理学家,现在是一名科学作家。这些年来,我一直坚持写博客,每周在 4gravitons.com 上发表关于物理学以及从事物理学研究的人的文章。
写关于物理学的博客越来越意味着在写关于 AI 的内容。这是一个问题,因为我绝对不是 AI 专家。我确实涉猎过 AI,可能比我奶奶懂得多。但大多数时候我只能退后一步,相信专家们。然而令人沮丧的是,专家们意见不一!我听过一些聪明且消息灵通的人,他们确信 AI 再过几年就会达到超级智能,而且那种智能将能够做到真正令人恐惧的事情。我也听过另一些同样聪明且消息灵通的人,他们同样确信基于 LLM 的 AI 已接近天花板,像 Claude 这样的模型甚至无法在物理学领域做出令人印象深刻的工作,更不用说征服世界了。
我一直不愿做出自己的预测。在形成观点之前,我想先看看 LLM 在某个我熟悉的领域是否取得进展——某个因为我自己曾尝试做过类似事情所以知道它很难的领域。
此外,我想看看 LLM 是否能做到我认为计算上很困难的事情。LLM 在数学方面确实取得了令人瞩目的进步,当然,仅这个月可能就已经改变了许多人的看法。但数学上的进步来自新想法,而想法是神秘的东西:在找到它之前,人们永远不知道它有多难找到。计算感觉更实在一些。我想看看 LLM 能否攻克一个挑战——之所以说它遥不可及,不是因为研究人员原则上不知道怎么做,而是因为做起来似乎需要更多的计算机和时间,超出了研究人员合理能够获取的范围。我想看看这些研究人员是否错了:一个更聪明的人工智能研究员能否使用同样的计算机,最终解决这个问题。
于是,我发出了挑战:
简而言之:AI 能否解决我前研究领域——理论粒子物理学前沿的问题?并且能否在有限预算内完成?
我的老本行是理论粒子物理学的一个分支,叫做振幅学(amplitudeology)。当其他粒子物理学家预测新粒子时,他们会确保能够完成计算来验证这些预测。他们计算被称为散射振幅的公式,这些公式让物理学家能够利用亚原子粒子的动量和能量来计算它们以特定方式发生反应的可能性。如果物理学家能够对这些反应做出更准确的预测,他们就能检查大型强子对撞机等实验的结果是否与预测相符。不匹配可能是一个新理论的证据——一个可能解释物理学中一些重大悬而未决之谜的理论,比如暗物质的本质,或者宇宙中物质与反物质之间的平衡。
这些散射振幅公式很难计算,难到物理学家几乎总是使用近似方法。他们做部分计算,停留在特定数量的“圈”(loops)上——这是衡量粒子间相互作用允许有多复杂的一个指标。他们在计算中包含的“圈”越多,就越接近真实答案,而计算也就越困难、越耗费算力。
实际上,大多数散射振幅公式只被计算到两圈。少数达到了三圈。你可能听说过的粒子物理学中最精确的预测用了五圈。振幅学家想要做得更好。他们开发实验性的新技巧,并在特殊的“玩具模型”理论上进行测试。通过在一个计算更容易的玩具模型上尝试技巧,而不是在现实世界中更复杂的粒子上,振幅学家可以对新方法进行压力测试,看看它们能走多远。
我为其中两个玩具模型发布了挑战。Anthropic 的人选择攻克的那个是:用某个特定的玩具模型理论——叫做 N=4 超杨-米尔斯理论(super Yang-Mills)——达到九圈。
“杨-米尔斯”是一个技术名称,指的是解释我们周围世界大部分现象的一类理论。自然界的四种基本力中有三种:电磁力、维持原子核在一起的强核力,以及导致香蕉等物质放射性衰变的弱核力,都是杨-米尔斯理论。
“N=4 超”来自超对称性。物理学家推测每个粒子都有一个“超对称伙伴”——一个带有相同电荷但不同类型的粒子,将物质粒子(如电子)与力粒子(如光子)对应起来。曾几何时,他们乐观地认为这些粒子可以解释暗物质,即通过更常见粒子的未发现伙伴来解释。那些推测使用的是“N=1”超对称性。而在“N=4”中,每个粒子有四个超对称伙伴,而不是只有一个。
大量的粒子使得这个理论很不现实。N=4 超杨-米尔斯理论并没有被用作暗物质的解释,也不是为了解释现实世界中的任何事物。相反,振幅学家用它来磨练他们的技术,因为 N=4 的计算反而更简单。不同粒子之间的微妙平衡意味着只需要某些变量组合,从而简化了计算。
这些计算使用了一种叫做 Bootstrap(自举法)的实验技术来完成,最终被证明意外地非常适合 AI 的使用。要对振幅进行自举,你不需要考虑每一种可能的粒子相互作用。你只需要大致知道答案应该是什么样子,用一种专门的字母表在计算机文件中跟踪每一种可能性。然后你开始检查你所知道的一切:来自其他计算技术的预测、答案必须遵守的规则、与相关问题的联系——在那些问题中答案更容易找到。这有点像数独,你从一个包含所有可能数字的网格开始,然后随着你的进行逐一划掉它们。最后,你希望发现只有一种可能性满足所有检查,同时还有足够的检查剩余下来以确保你没有犯错。
这意味着 Lance 已经准备好验证是否有人给了他下一个振幅公式——九圈的。那将是一个有趣的答案,不仅作为对自举技术的验证,而且作为这种复杂度圈数的振幅的罕见例子——一个本身就值得研究的答案。
但他没有计算过,领域中也没有任何人计算过。他找到八圈答案的方式已经有点间接,是通过一个令人惊讶的链接,连接到另一个相关公式——叫做形状因子(form-factor)——一种涉及不同粒子的部分振幅,结果计算起来稍微容易一些。他原本以为找到下一圈会更加间接,可能需要通过另一种 AI 方法。如果人们认为可以对常规的自举方法再跑一圈,那早就有人做了。
显然,Anthropic 有人读我的博客。
八月底,Anthropic 的两位物理学家 Liam Fitzpatrick 和 Siddharth Mishra-Sharma 联系了我,说他们已经攻克了我帖子中的一个挑战。在与 Lance 一起验证结果后,他们向我讲解了他们是如何做到的。
为了呼应挑战的精神,他们没有使用数百万美元的算力。他们使用了 Fable 5.1,在 Claude Science 平台上工作——这是一个科学家可以付费使用的平台。Claude Science 是业内人士所说的“工具链”(harness),一个使用带有结构化规则和提示的 Claude LLM 以获得更稳健、更具科学实用性的行为的程序。
显然,在询问 Claude 它最有可能攻克哪个问题之后,他们给了它一个简单的提示:
“问题是计算 planar N=4 SYM 中六粒子(六边形)振幅在九圈的结果。”
从那里开始,他们只是不断告诉它继续做下去,评论如下:
“我要去睡觉了,接下来几个小时都无法操作。继续做这件事,直到我让你停止。每隔 4-6 小时给我更新。”
Claude 最终用了两种不同的方式完成了计算:原始的自举法,以及间接的形状因子方法。对于最终用户来说,每种方法大约花费一到两千美元,主要是因为运行 Claude 这么长时间的费用。使用 Python 编程语言和 SymPy 包进行的自举计算花了大约 100 美元的预算,相当于运行 96 个 CPU 一周。
Running 96 个 CPU 运行一周,在我十年前做这类工作时可能觉得是一笔大开销,但现在如果你有个充分的理由,这已经相当便宜了。
事实证明,对人类来说结果也相差不远。在我收到 Anthropic 回复的几天后,我们收到了宋贺的来信——他是北京中国科学院的振幅学家。宋贺的团队已经完成了大部分结果。他们使用了一些基于 GPT-6 的 AI 辅助,但不是 Anthropic 那种近乎无人值守的一次性方案。
大家相处得都很友善,这让我松了一口气。人类——Lance、宋贺及其合作者们——将发表这些结果,花时间解释和分析它们,以造福未来的研究者。Claude 的角色就到此为止了。
我设定这个挑战,是因为我想更好地了解当前的 AI 能做什么,以及它接下来能走向何方。所以我学到了什么?
我原以为这可能是一个看到 AI 以令人惊讶的方式突破计算障碍的机会。但实际上,它做到的事情原来人类也能做到。Claude 使用的是已知的方法,只是比人们之前尝试使用的计算量稍多一些。它可能因为使用 Python 而获得了优势(而不是 Lance 最喜欢的数学程序 Maple 或我的 Mathematica),而且它的软件工程实践可能比我们做得更好,但并没有达到超级智能的程度。
我最大的收获是:意想不到的低垂果实比你想象的更多。即使目标简单明确,有时候它在专家眼中看起来也比实际可实现的要困难得多。有计算机科学背景的人多年来一直告诉我,振幅学家们只需要雇几个程序员就能取得更多进展。他们现在应该感到扬眉吐气了。
同样值得注意的是,Claude Science 是一次完成的,没有比"继续下去"更复杂的科学监督。这些计算非常精细和杂乱。如果我用一周时间在 96 个 CPU 上做这种计算,那我几乎肯定会花两周时间:几乎可以保证我第一次尝试时会搞砸什么。我不知道 Claude 在过程中内部犯了多少错误,但整个框架让它在没有外部协作输入的情况下到达终点。在这一点上,我不确定这是否让我惊讶。但如果你不知道它能做到这一点——因为你仍然认为 AI 容易出错到无法使用的地步——那么这应该是你的收获:它现在可以可靠地完成这类事情。
事情确实在快速发展。三月份,AI 完成物理项目的方式还像个学生:小规模任务,需要大量手把手指导和修正。相比之下,这是一次真正的前沿计算,是振幅学顶级专家通常处理的那种。虽然这可能只是一个对 AI 更友好问题的可能性更大,但我不认为仅仅如此:我认为技术确实已经真正进步了。
我能将这个结论推广多远?这一点我不确定。
这些玩具模型理论往往是小型社区的关注焦点。真实世界的振幅计算是一个更广阔的领域,许多团队竞相争夺前沿。那里可能低垂的果实更少。但我不应该指望这一点。我知道从事这些计算的人越来越多地在编程中使用 AI。如果人们还没有在检查 AI 科学框架是否能一次性完成那里的前沿计算,他们应该去检查(而且应该有计划地检查结果)。如果能在合理预算下再挤出一个圈(loop),我不会感到太惊讶。
然后这就变成了社区需要讨论的问题:新的前沿在哪里,接下来需要弄清楚什么?与数学中的许多问题不同,振幅不仅仅是新方法的训练场。有一个目标:使预测足够精确,以与即将到来的实验进行比较。这个领域离那个目标还有多远?
不过,更广泛地说,我真的没有得到答案。
我进入这个探索时不仅仅好奇 AI 今天能在研究中做什么,还好奇它的未来。当你在 LLM 出现之前的时代阅读关于超级智能的预测时,它们经常提出看似奇幻的风险。人们想象 AI 可以模拟人来预测他们的反应并操纵他们,或者从第一性原理弄清楚如何构建一种能毁灭物种的病毒或吞噬世界的纳米技术。而对这些风险的常见反驳是:它们混淆了智能——那个模糊而神秘的新思想源泉——与计算能力。批评者认为,即使是一批新的数据中心也没有足够的计算能力来完成这些任务,它们只是科幻未来的噩梦,不会很快到来。
我对那些批评者并没有更好的答案。我学到了一些关于 AI 现在能做什么的东西:它可以在合理预算内在我原来的领域完成重要的计算,而且几乎可以自主完成。但我希望看到一些更奇怪的东西——为计算本身开发的新方法,具有意想不到的力量。我希望能瞥见未来,获得一些能够让我在关于超级智能的辩论中形成有依据的观点的东西。我想知道 AI 能把计算极限推到哪里……而我在这里学到的是,我只是对极限在哪里太过天真了。
附言:被一台机器抢发是什么感觉?
Lance Dixon,SLAC 国家加速器实验室和斯坦福大学粒子物理与天体物理教授,验证了 Claude 的九圈结果。
我认识的大多数理论物理学家都认识到,当前的大型语言模型时代将彻底改变我们思考物理的方式。问题只是:什么时候它才会真正深入人心?对我来说,答案是 9 月 1 日,那天 Anthropic 的 Liam Fitzpatrick 和 Siddharth Mishra-Sharma 告诉我,Claude 已经计算出了 planar N=4 超杨-米尔斯理论中的九圈 MHV 六粒子振幅,并请我验证其结果。
我不打算解释上一句话中的所有技术术语;Matt 已经在上文中介绍了背景。我确实需要提到,实际上有两个相关对象,"振幅"(amplitude)和我们所说的"形状因子"(form factor)。每个对象都有相关的圈数:一圈、两圈、三圈,等等。每一圈都比前一圈在计算上更难,即使在找到了很多简化技巧之后也是如此。同样,在同一圈数下,形状因子比振幅更容易。2023 年,Andy Liu 和我展示了如何使用形状因子和我们称之为"对跖对偶性"(antipodal duality)的奇异对称性来得到八圈的振幅。
自 2023 年以来,我和合作者们一直盯着到达九圈,首先是形状因子,然后是振幅,使用我们 2023 年的想法。我原以为直接做振幅会太难了。所以 Claude 能直接做到真的让我印象深刻。不仅仅是因为那是一个大型计算任务,而是因为整个设置非常脆弱:如果你在计算配方中犯了任何错误,一切都会像失败的舒芙蕾一样崩溃,然后你只能疑惑为什么(然后调试)。此外,构造过程中有太多细节太无聊了,无法在论文中完全记录。所以 Claude 必须从头开发所有代码。
从九圈振幅相对容易回推到形状因子,所以我大部分是通过这种方式验证结果的。这意味着在过去的两周里,我一直在验证一个结果——九圈形状因子——这是我们团队几年来一直在努力的目标。而一台机器解决了我认为太难而无法直接解决的问题。这让我困扰吗?令人沮丧吗?
不,有两个原因。其一,我们团队已经有一个使用自定义 Transformer 模型来预测更高圈数的计划,我们部分口号是:"我们拥有所有工具来验证机器提供给我们的任何候选解决方案。" Claude 是一种不同类型的 Transformer 模型,可能比我们自定义的那个大一百多万倍。但当然,我们说过我们可以验证任何 AI 模型给我们的结果,所以我们应该做,也能够做到。其二是,如果你看看 Claude 是如何解决这个问题的,它使用了我的合作者们多年来开发的所有方法,而且它(也许是给我们一个面子)以我们已建立好的相同格式呈现了解决方案。所以当我验证 Claude 的结果时,Claude 也在验证我们之前的所有工作。事实上,我敢说 Claude 比任何人类都更理解我们 2019 年和 2023 年的论文——除了我的合著者们。
After I wrote this, Song He told me that his group had also computed the piece of the nine-loop amplitude called the symbol. (People just seem to like to tell me about their nine-loop successes, for whatever reason.) Song's group used AI (GPT-6) to help them compute some of the constraints, but not for the overall framework. So now I've been scooped by both a machine and by humans plus a machine, within two weeks.
回到 Claude 的计算:在我看来,一个大语言模型能够执行我们制定的复杂配方中的所有步骤,并组织起计算能力,这是一项相当大的成就。但更发人深省的时刻将会到来——当大语言模型开始在人类之前提出新的物理原理和见解时。
The full nine-loop result, in the format used for the earlier loop orders;
The concurrent nine-loop result by Song He, Jirong Jing, and Xiang Li.
Anthropic invited Matt von Hippel to write this post and compensated him for his time. Anthropic staff gave feedback on drafts; the content and opinions are his own. Lance Dixon validated the result independently and received Claude usage credits.
Project Swap: What happens when agents trade for us?
To see what works and what breaks when agents are sent into a market, we made a miniature market of Claudes—a more controlled sequel to Project Deal, our first experiment with agents interacting in a marketplace on people's behalf.
How Claude is uplifting biomolecular modeling
Claude made the open-source models that scientists use to predict and design biomolecules faster and more memory-efficient. Claude optimized more than 30 of these models in just under four weeks, speeding them up roughly 4x on average. It also created a low-memory mode that enables the accurate prediction of biomolecular systems larger than 10,000 tokens (amino acids, nucleotides, and atoms from small molecules and ions) on a single NVIDIA GPU node.
Measuring tactical intelligence targeting and conventional weapons capabilities of AI models
Anthropic's Frontier Red Team developed new evaluations to measure AI capabilities in tactical intelligence targeting and conventional weapons development.