跳到正文
Anthropic Research·· 12 天前精选AI 评分66

Claude 完成 N=4 超杨-米尔斯九圈振幅计算

Yes, Claude can do Nine Loops

AI 导读

物理学家 Matt von Hippel 在 Anthropic 研究博客中复盘,他此前向 AI 公司发出挑战,要求用学术机构可负担的算力求解理论粒子物理散射振幅的前沿问题。

推荐理由

作者以物理学家的第一手视角复盘 AI 完成九圈振幅计算的经过,并给出对当前 AI 科研能力的克制判断。

正文 · AI 翻译

在这篇客座文章中,物理学家兼科学作家 Matt von Hippel 分享了他向 AI 公司发起挑战、针对他曾经所在的理论物理子领域中的一个问题时所发生的事情。

Illustration of nine-loops

你发出一个挑战,结果一个月后就被人攻克,这种事可不常见。但我们正生活在一个不寻常的时代。

让我自我介绍一下:我是 Matt von Hippel。我曾经是一名理论物理学家;如今我是一名科学作家。一直以来,我都是一名博主,每周在 4gravitons.com 上撰写关于物理学以及从事物理学的人的文章。

越来越多地,写关于物理学的博客意味着写关于 AI 的博客。这是个问题,因为我绝对不是 AI 专家。我确实涉猎过一些。我大概比你奶奶懂得多。但我大多时候不得不退后一步,信任专家。而令人沮丧的是,专家们意见不一!我听过一些聪明、见多识广的人自信地认为,AI 距离超级智能只有几年之遥,而超级智能将能够做出真正可怕的事情。我也听过一些同样聪明、同样见多识广的人同样自信地认为,基于 LLM 的 AI 已接近天花板,像 Claude 这样的模型甚至无法在物理学中做出令人印象深刻的工作,更不用说征服世界了。

我一直不愿做出自己的预测。在形成观点之前,我想看到 LLM 在某个我熟悉的事情上取得进展,某个我知道很难做到的事情,因为我自己曾尝试做过类似的事情。

除此之外,我还想看到 LLM 做一件我认为在计算上很难的事情。LLM 在数学上确实取得了令人瞩目的进步,而且仅这个月就可能改变了许多人的想法。但数学的进步来自新想法,而想法是神秘的东西:在找到之前,你永远不知道它们有多难找。计算感觉更实在。我想看到 LLM 应对一个看似遥不可及的挑战,不是因为研究人员原则上不知道如何去做,而是因为做这件事似乎需要比研究人员合理拥有的更多的计算机和时间。我想看看那些研究人员是否错了:一个更聪明的、人工的研究者能否使用同样的计算机,仍然解决这个问题。

于是,我发出了一个挑战:

“如果 AI 公司想打动像我这样的人(或者吓到我们,就此事而言),那么他们需要攻克我以前的领域。展示一个 AI 能够利用一名学者所能获得的计算机资源,解决散射振幅领域的一个重大未解问题。展示一个所有人都以为会成为问题的计算限制实际上并不重要。给我们 N=8 超引力到七圈,或者 N=4 超对称杨-米尔斯到九圈。”

简而言之:AI 能解决我以前的粒子理论物理子领域中的一个前沿问题吗?而且它能在预算有限的情况下做到吗?

挑战

我原来的领域是理论粒子物理的一个分支,叫做振幅学。当其他粒子物理学家预测新粒子时,他们会确保自己能够进行计算来检验这些预测。他们计算被称为散射振幅的公式,这些公式让物理学家利用亚原子粒子的动量和能量来计算它们以特定方式发生反应的可能性。如果物理学家能够对这些反应做出更精确的预测,他们就可以检验大型强子对撞机等实验的结果是否与这些预测相符。不匹配可能成为新理论的证据,这种理论可以解释物理学中一些长期存在的重大谜团,比如暗物质的本质,或者宇宙中物质与反物质之间的平衡。

这些散射振幅公式很难计算,难到物理学家几乎总是使用近似方法。他们进行部分计算,在特定数量的“圈”处截断,“圈”是粒子之间相互作用被允许达到的复杂程度的一种度量。他们在计算中包含的“圈”越多,就越接近真实答案,而计算在计算上也越难完成。

在实践中,大多数散射振幅公式只被计算到两圈。少数被计算到三圈。你可能听说过的最精确的粒子物理学预测用到了五圈。

振幅学家希望做得更好。他们开发实验性的新技术,并在特殊的“玩具模型”理论上进行测试。通过在计算更容易的玩具模型上尝试该技术,而不是在现实世界中更具挑战性的粒子上尝试,振幅学家可以对新技术进行压力测试,并看看它们能走多远。

我为其中两个玩具模型发布了挑战。Anthropic 的人选择攻克的那个,是在一个名为 N=4 超杨-米尔斯的特定玩具模型理论中推进到九圈。

“杨-米尔斯”是一类解释我们周围大部分世界的理论的技术名称。自然界四种基本力中的三种:电磁力、将原子核束缚在一起的强核力,以及导致香蕉等事物发生放射性衰变的弱核力,都是杨-米尔斯理论。

“N=4 超”来自超对称。物理学家曾推测,每个粒子都有一个“超对称伙伴”,这是一种电荷相同但类型不同的粒子,将电子等物质粒子与光子等力粒子对应起来。他们一度乐观地认为,通过这些更熟悉粒子的未发现伙伴,这些粒子可以解释暗物质。那些推测使用的是“N=1”超对称。在“N=4”中,每个粒子有四个超对称伙伴,而不仅仅是一个。

粒子如此之多使该理论非常不现实。N=4 超杨-米尔斯并不被用作对暗物质或现实世界中任何事物的解释。相反,振幅学家用它来磨练自己的技术,因为矛盾的是,N=4 更容易计算。不同粒子之间的微妙平衡意味着只需要某些变量组合,从而简化了计算。

我获得博士学位时曾帮助计算一个三圈振幅,在开始失去动力之前,我曾有机会看到七圈。SLAC 国家加速器实验室的教授兰斯·迪克森是从一开始就参与这项工作的人之一,几年前他设法完成了八圈。

这些计算是用一种叫做“自举”(bootstrap)的实验性技术完成的,而这项技术最终出奇地适合使用 AI。要对一个振幅进行自举,你不需要考虑每一种可能的粒子相互作用。你只需要大致知道答案应该是什么样子,并用一种专门的字母表在计算机文件中记录下每一种可能性。然后你开始核对你知道的一切:来自其他计算技术的预测、答案必须遵守的规则、与那些答案更容易找到的相关问题的联系。这有点像数独,你从一个填满所有可能数字的网格开始,然后一边做一边把它们划掉。最终,你希望发现只有一种可能性满足所有校验,同时还有足够的校验余量来确保你没有犯错。

这意味着 Lance 已经做好了充分准备,可以检验是否有人把下一个九圈振幅公式交给了他。那将是一个有趣的答案,不仅是对自举技术的一次验证,更是一个罕见的、具有如此多圈复杂度的振幅实例,其本身就可能值得研究。

但他没有算出来,这个领域的其他人也没有。他找到八圈答案的方式已经有点间接了,是通过一个令人惊讶的联系,联系到一个不同但相关的公式,叫做形状因子(form-factor),这是一种涉及不同粒子的部分振幅,结果发现它算起来稍微容易一些。他原本预计找到下一个圈数会更加间接,可能是通过另一种 AI 方法。如果人们认为只要把通常的自举方法再跑一圈就能做到,那早就有人做了。

然后人们真的做到了

显然,Anthropic 有些人读了我的博客。

八月底,Anthropic 的两位物理学家 Liam Fitzpatrick 和 Siddharth Mishra-Sharma 联系我,说他们解决了我博文中的一个挑战。在与 Lance 核实结果后,他们向我讲述了他们是如何做到的。

本着这一挑战的精神,他们并没有使用价值数百万美元的算力。他们使用的是 Fable 5.1,运行在 Claude Science 中,这是一个科学家可以付费使用的平台。Claude Science 就是业内人士所说的“harness”(套具),一种使用 Claude LLM 并配合结构化规则和提示词的程序,以获得更稳健、更有科学实用性的行为。

显然,在询问 Claude 它最有可能解决哪个问题之后,他们给了它一个简单的提示词:

“问题是计算平面 N=4 SYM 中九圈下的六粒子(六边形)振幅。”

从那里开始,他们只是不断告诉它继续做下去,并附上这样的评论:

“我要去睡觉了,接下来几个小时都没空。继续做这件事,直到我让你停。每 4 到 6 小时给我一次进展更新。”

Claude 最终用两种不同的方法完成了计算:原始的自举法,以及间接的形状因子方法。无论哪种方法,对最终用户来说都要花费大约一到两千美元,主要原因是长时间运行 Claude 的费用。用 Python 编程语言配合 SymPy 包完成的自举计算,大约占用了 100 美元的预算,相当于让 96 个 CPU 运行一周。

在我十年前做这类工作时,让 96 个 CPU 运行一周可能感觉很多,但如今如果你有充分的理由,这已经相当负担得起了。

事实证明,对于人类来说,结果也并非遥不可及。在我收到 Anthropic 的消息几天后,我们收到了宋赫的消息,他是北京中国科学院的一位振幅学家。宋的团队已经得到了大部分结果。他们借助了一些基于 GPT-6 的 AI 辅助,但并非 Anthropic 那种几乎无人参与的一次性方法。

这里的每个人都很友好,这让人松了一口气。人类——Lance、宋和他们的合作者——将得以发表这些结果,花时间解释和分析它们,以造福未来的研究者。Claude 的角色目前已经完成。

那么,问题解决了吗?

我设定这个挑战,是因为我想更好地了解当前 AI 能做什么,以及它从这里可能走向何方。那么我学到了什么?

我本以为这可能是一个机会,看到 AI 以令人惊讶的方式克服计算障碍。相反,它做了一件人类也能做到的事。Claude 使用了已知方法,只是比人们之前尝试使用的计算量稍多一些。它可能因为使用了 Python 而不是 Maple(Lance 最喜欢的数学程序)或 Mathematica(我最喜欢的)而获得了提升,也可能使用了比我们好得多的软件工程实践,但并非超级智能的那种。

我最大的收获是,那里有比你预想更多的低垂果实。即使一个目标简单且定义明确,有时在专家看来也比实际要难以实现得多。多年来,一直有计算机科学背景的人告诉我,振幅学家只要雇几个程序员就能取得更大进展。他们应该感到被证明了。

同样值得注意的是,Claude Science 一次性完成了这件事,没有任何比“继续”更复杂的科学监督。这些是挑剔、混乱的计算。如果我用了 96 个 CPU 一周的时间来做这种计算,那么我几乎肯定会最终用上两周:我几乎保证会在第一次尝试时搞砸某些东西。我不知道 Claude 在内部过程中犯了多少错误,但框架让它走到了最后,没有外部合作者的输入。在这一点上,我不确定这让我惊讶。但如果你不知道它能做到这一点,因为你仍然认为 AI 太容易出错以至于无法使用,那么这应该是你的收获:它现在可以可靠地做这类事情了。

事情显然进展得很快。在三月,AI 完成物理项目还像学生一样:规模较小的任务,需要大量手把手指导和犯错。相比之下,这是一次真正的前沿计算,通常由振幅领域的顶尖专家处理的那种。虽然这可能只是一个对 AI 更友好的问题,但我认为不仅仅是那样:我认为这项技术确实变得更好了。

我能把这个推广到什么程度?这一点我不确定。

这些玩具模型理论往往是小型子社群关注的焦点。现实世界中的振幅计算是一个更广阔的领域,有许多团队竞相争夺前沿。那里的低垂果实可能更少。但我不会指望这一点。我认识从事这些计算的人,他们越来越多地使用 AI 来编写代码。如果人们还没有在检查 AI 科学工具能否在那里一次性完成前沿计算,他们应该这样做(而且他们应该有一个如何检查结果的计划)。如果在合理的预算内能够再挤出一个圈,我不会感到太惊讶。

然后这就成了社群需要讨论的问题:新的前沿在哪里,接下来需要弄清楚什么?与数学中的许多问题不同,振幅不仅仅是新方法的训练场。它有一个目标,即做出足够精确的预测,以便与即将进行的实验进行比较。该领域离这个目标还有多远?

不过,更广泛地说,我并没有真正得到答案。

我对此感到好奇,不仅是因为 AI 今天在研究中的能力,还因为未来。当你阅读 LLM 出现之前那些关于超级智能的预测时,它们常常提出看似荒诞的风险。人们想象 AI 可以模拟人来预测他们的反应并操纵他们,或者从第一性原理出发弄清楚如何制造灭绝物种的病毒或吞噬世界的纳米技术。而对这些风险的常见反驳是,它们混淆了智能——新思想那模糊而神秘的来源——与计算能力。批评者认为,即使是一批新的数据中心,也不具备完成任何这些任务的计算能力,它们是科幻未来的噩梦,短期内不会到来。

对于那些批评者,我并不觉得自己有更好的答案。我了解了一些 AI 现在能做什么,它能在合理的预算下完成我旧领域中有意义的工作,而且几乎可以自主完成。但我原本希望看到更奇怪的东西,即计算本身具有意想不到威力的新方法。我原本希望一窥未来,让我在关于超级智能的辩论中能有见地的观点。我想知道 AI 能把计算极限推到多远……而我觉得我在这里学到的只是,我对极限所在之处太天真了。

附记:被机器抢先一步是什么感觉?

作者:Lance Dixon,SLAC 国家加速器实验室和斯坦福大学粒子物理与天体物理学教授,他验证了 Claude 的九圈结果。

我认识的大多数理论物理学家都认识到,当前的大语言模型时代将彻底改变我们思考物理学的方式。问题只是:它什么时候会真正深入人心?对我来说,它发生在 9 月 1 日,当时 Anthropic 的 Liam Fitzpatrick 和 Siddharth Mishra-Sharma 告诉我,Claude 计算了平面 N=4 超杨-米尔斯理论中的九圈 MHV 六粒子振幅,并请我验证其结果。

我不会解释最后那句话里的所有技术术语;Matt 已经在上文介绍了背景。我确实需要提到,实际上有两个相关的对象,即“振幅”和我们称之为“形状因子”的东西。每个对象都有相关的圈数:一圈、两圈、三圈,等等。在计算上,每一圈阶都比前一阶更难,即使已经找到了许多让事情变简单的技巧。此外,在相同圈阶下,形状因子比振幅更容易。2023 年,Andy Liu 和我展示了如何使用形状因子以及我们称之为对跖对偶的一种奇特对称性来得到八圈的振幅。

自 2023 年以来,我和我的合作者一直着眼于利用我们 2023 年的想法达到九圈,先是形状因子,然后是振幅。我认为直接做振幅会太难。所以 Claude 能直接做到这一点,让我印象非常深刻。倒不是因为它是一项巨大的计算任务,而是因为整个设置非常脆弱:如果你在计算配方中犯了任何错误,它就会像失败的舒芙蕾一样整个塌掉,而你只能纳闷为什么(并去调试)。此外,这个构造有太多细节,无聊到无法在论文中完整记录。所以 Claude 不得不从零开始开发所有这些代码。

从九圈振幅相对容易回到形状因子,而对我来说,主要也是通过这种方式来验证结果更容易。这意味着在过去两周里,我一直在验证一个结果,即九圈形状因子,而这是我们团队已经努力了几年才达到的。而一台机器解决了一个我认为直接做太难的问题。这让我个人感到困扰吗?这让人心力交瘁吗?

不,有两个原因。其一,我们团队已经有一个计划,使用定制的 transformer 模型来预测更高圈数,而我们的口号之一就是:“我们拥有所有工具来验证机器提供的任何候选解。”Claude 是一种不同类型的 transformer 模型,可能比我们的定制模型大一百多万倍。但当然,我们说过我们可以验证 AI 模型给我们的任何结果,所以我们能够也应该这样做。第二个原因是,如果你看看 Claude 是如何解决这个问题的,它使用了我和我的合作者多年来开发的所有方法,并且(也许是帮我们一个忙)以我们已经设定好的相同格式呈现了解决方案。所以,当我在验证 Claude 的结果时,Claude 也在验证我们之前的所有工作。事实上,我敢断言,除了我的合著者之外,Claude 比任何人类都更理解我们 2019 年和 2023 年的论文。

在我写下这些之后,Song He 告诉我,他的团队也计算出了九圈振幅中被称为 symbol 的那一部分。(不知为何,人们似乎就是喜欢告诉我他们的九圈成功。)Song 的团队使用 AI(GPT-6)帮助他们计算了一些约束条件,但没有用于整体框架。所以现在,我在两周内既被一台机器抢先,又被人类加机器抢先。

回到 Claude 的计算:在我看来,一个大语言模型能够执行我们制定的复杂配方中的所有步骤,并组织起计算算力,这相当了不起。但更值得深刻反思的时刻,将会出现在大语言模型开始先于人类提出新的物理原理和洞见之时。

补充材料

披露

Anthropic 邀请 Matt von Hippel 撰写本文并为其时间支付了报酬。Anthropic 员工对草稿提供了反馈;内容与观点均为其个人所有。Lance Dixon 独立验证了该结果,并获得了 Claude 使用额度。

相关内容

Claude 形态的科学

客座作者 Matthew Schwartz 教授描述了当他不再与 Claude 对抗,转而让 Claude 去发现“Claude 形态”的问题时发生的事:这类问题最适合当前一代 LLM 工具的能力。这促使他构建了 BootLoops——一个用于定量科学中精确计算的工具包,他一直在与各领域专家一起将其应用于多个科学领域。

阅读更多

机器人能做什么工作?

我们构建了一个指数,衡量当今机器人执行美国工作任务的能力。机器人已经能完成四分之三的体力任务,但大多是在受限环境中;然而仅在 0.3% 的任务上具备成本竞争力。

阅读更多

你想从 AI 得到什么?

我们正在启动一项新研究,使用 Anthropic Interviewer 来了解你与 AI 相处的经历。

阅读更多

来源:Anthropic Research · anthropic.com