OpenAI 一次性放出近 400 项 AI 生成数学成果,数学家称需数年消化
‘Pure insanity’: Mathematicians will need years to make sense of OpenAI’s latest drop
OpenAI 本周突然发布近 400 项 AI 生成的数学结果,分布在 700 多份手稿中,涵盖组合数学、几何、数论、拓扑、概率与数学物理等多个分支,并为此在 GitHub 上发布了仓库导航指南。
同一新闻,精选展示《OpenAI 发布内部前沿模型产出的新数学结果》
译文尚不完整,完整内容请切换到原文。
“令人震惊。”“铺天盖地。”“前所未有。”“超现实。”“纯粹疯狂。”
这是超过三四十位数学家在与我交谈时用来形容本周 OpenAI 突然向该领域抛出的海量数学成果的词语。在敬畏、兴奋和对这场洪流规模的难以置信之中,还潜藏着一种深层的焦虑——这一切意味着什么,以及接下来会发生什么。尽管反应各异,研究人员一致认为,仅仅理解 OpenAI 发布了什么就可能需要数年时间,更不用说弄清楚数学家们自己在这个正围绕他们发生变化的领域中处于什么位置了。许多人担心,OpenAI 不会等那么久才继续前进——或者发布更多成果。
总体而言,OpenAI 发布了近 400 项 AI 生成的成果。这些成果分布在 700 多份手稿中,涵盖了广泛的数学学科,包括组合数学、几何学的若干分支、数论、理论计算机科学、代数、拓扑学、概率与统计力学以及数学物理。这个合集如此庞大,以至于 OpenAI 觉得有必要发布指南,说明如何浏览这个庞大的 GitHub 仓库。
工作量之巨大,使得即便只是初步评估该公司究竟发布了什么都很困难。在发布后的数小时和数天里,大多数接受我采访的数学家表示,他们仍在努力消化所有内容;有几位说,仅仅通读大约 40 页的目录和摘要就花了他们将近一个小时。“光是浏览整个摘要列表就让人不堪重负,”康涅狄格大学数学教授 Álvaro Lozano-Robledo 说。
在数百份手稿中,还散布着 Lean 形式化证明。Lean 是一种编程语言和证明助手,可以通过计算来验证结果。这些形式化证明在评估 OpenAI 此前的一些数学主张时已被证明至关重要,让研究人员即便没有完全理解某个主张背后的论证,也能对其逻辑正确性抱有信心。
“如果 AI 现在消失,就像外星人来到地球然后又离开了一样,我们也会在未来 10 年里研究这个,试图理解一切。”
但每项成果被验证的程度差异极大。在 GitHub 上,OpenAI 承认这些成果“处于不同的验证阶段”,并且“许多,但并非全部,手稿已被形式化”。截至撰稿时,该合集中似乎只有不到一半的手稿被正式描述过。OpenAI 表示,719 份手稿中只有 300 项顶级成果已被形式化,约占 42%,并且它“将在获得更多形式化证明后更新仓库”。
多位数学家向 The Verge 抱怨缺乏形式化,尤其是考虑到成果数量之庞大,并强调即便某项结果附带了 Lean 代码,评估也并非一蹴而就。研究人员必须核查形式化是否真正证明了该结果所声称的内容,这又是一个耗时的过程;几位深入研读论文的人表示,即便提供了可由计算机验证的证明,其质量也参差不齐,而且它们所验证的命题并不总能与随附手稿中的主张严丝合缝地对应。
伦敦帝国理工学院数学教授 Kevin Buzzard 表示,他在自己所属的代数数论领域识别出了大量定理,其中只有大约六个立刻“脱颖而出”。这些定理中,似乎几乎没有几个在 Lean 中被形式化验证过。“因此,我要么得去读那些可能并不正确的垃圾内容,要么等别人也去读,要么等有人把它们形式化,然后我才能确定这些结果究竟是否正确。”Buzzard 的担忧得到了众多其他研究者的呼应。
担心 AI“垃圾内容”的远不止 Buzzard 一人。这个词是低质量、常常错误的 AI 生成材料的简称,这类内容正越来越多地出现在网上——以及现实世界中——包括学术论文。与其他领域一样,数学家们告诉 The Verge,近年来他们看到用 ChatGPT 和 Claude 等工具生成的此类材料大幅增加。其中许多内容令人困惑、难以阅读,且几乎不体现对主题的理解;在给其他研究者署名方面尤其粗劣。
OpenAI’s previous mathematical write-ups were widely criticized by experts for their sloppy nature, particularly their poor or nonexistent attribution. In conversations with The Verge ahead of the release, several researchers had taken to calling the impending flood of papers the “slopocalypse,” or similar variations on the theme.
所担心的“slopocalypse”是否真的成为现实,很难说,主要是因为发布出来的材料数量多得令人眼花缭乱。早期迹象表明,OpenAI 这一次在论文上更为用心,至少对其中一些是如此。几位数学家告诉 The Verge,他们的第一印象远好于预期,尽管他们自己也承认,鉴于该公司此前粗劣的出版物,这个门槛本来就不高。
“这是一团大乱。它可能导致学术文化的大崩塌,并直接毁掉大多数院系。这是一个社会问题,而 AI 实验室似乎完全无视了这个问题。”
但更好并不一定意味着好,更不用说达到人们通常对提出如此重大主张的学术工作所期望的标准了。由于 OpenAI 的许多主张缺乏形式化验证,随附论文的质量就变得尤为重要;它们是数学家们确认、理解、审视并为这些结果提供背景的主要途径。
即使在最理想的情况下,产出严谨的数学论文也是一项艰难的工作。以这种规模来做,更是一项艰巨的任务。OpenAI 的模型正以令人眼花缭乱的速度、横跨广泛的专业领域大量产出数学成果,远远超出了其人类员工的处理能力。该公司根本不具备足够的专业广度或资源,来妥善审查其在数学前沿的发现。研究人员告诉 The Verge,这一点已经显露出来。
许多人描述这些论文难以理解,有时几乎无法读懂。“我最熟悉的那个问题的论文,我快速读了一遍,几乎不知所云,”布朗大学的数学教授 Brendan Hassett 告诉 The Verge。“如果这是一个人写的,我不会再花时间去试图理解它。当然,这还剩下另外 721 篇预印本!”(Hassett 说这话时,OpenAI 尚未撤回三篇论文)。
一些研究人员告诉 The Verge,他们或同事注意到有几篇论文似乎覆盖了其他数学家已经涉足的领域,但在有机会妥善审阅材料之前,他们不愿公开这么说。其他人则指出这些工作异常简短,通常他们预期需要数百页才能展开的结果,被压缩到了几十页甚至更少。
澳大利亚悉尼大学的数学教授 Nalini Joshi 表示,快速检索这批发布内容后,她发现与自己工作重叠的部分很少,但她指出,她查看的一些论文“参考文献很短”。鉴于此前对 OpenAI 署名做法的批评,她说她“担心论文中的署名可能缺少完整的信息”。
但尽管存在这些粗制滥造和不确定性,总体共识是,这批发布内容中包含一些确实令人印象深刻的工作。
在强调评估如此大量材料的困难——以及妥善验证结果的必要性——的同时,多位接受 The Verge 采访的研究人员表示,尽管在呈现方式上存在不足,这些工作似乎水准非常高。他们说,在 AI 出现之前的世界里,OpenAI 的许多成果显然足以发表在顶级期刊上,也足以让作者获得一份学术生涯。其中少数成果被描述为那种能让一位数学家成为菲尔兹奖——该领域最高荣誉之一——有力竞争者的工作。
“我要么得去读那些可能并不正确的粗制滥造之作,要么等别人去读,要么等有人把它们形式化,然后我才能确定这些结果是否正确。”
斯坦福数学家 Jared Duker Lichtman 表示,他会把“数十项”成果归入这一类别,包括在黎曼猜想上的进展、霍奇猜想的一个特例,以及四维挂谷猜想的解决。这些都是数学领域的重大问题。黎曼——可以说是整个学科中最臭名昭著的未解难题——和霍奇都位列著名的七大千禧年大奖难题之中。它们分别关注素数的分布,以及大致来说,如何用更简单的构件来理解复杂的几何形状。与此同时,挂谷猜想大致是在问,要让一根针或一支铅笔朝各个方向旋转,所需的空间可以小到什么程度。三维挂谷猜想的证明,正是纽约大学数学家王虹今年早些时候被授予菲尔兹奖的成果之一。
“并不是说这些只是没人听说过的无聊问题,”数学家 Scott Armstrong 说。“其中许多都是非常著名的问题,很多人已经尝试了几十年。”
随着尘埃开始落定,数学家们发现自己面对的是一片骤然改变的地貌。他们中的许多人刚刚目睹多年的工作和精心制定的研究计划瞬间化为乌有,或者认识遭遇同样命运的同行。在整个领域,无论反应中夹杂着兴奋、恐惧、绝望还是介于其间的情绪,都有一种深深的迷失感。
到第二天早上,这种情绪并没有太大改变。Armstrong 在穿过巴黎时通过电话表示,他想象如果索邦大学没有因持续的学生抗议而关闭,同事们像往常一样聚在咖啡机旁,气氛会相当“肃穆”。
在苏格兰,圣安德鲁斯大学数学教授 Colva Roney-Dougal 描述了同事和学生之间同样阴郁的气氛。她说,这股洪流感觉有些“可怕”,但在数周的不确定性之后,它的到来也带来了一些解脱。“我有一大群朋友和同事的经费申请刚刚被一笔勾销,”她说。
“我有一大群朋友和同事的经费申请刚刚被一笔勾销。”
Armstrong 说,他知道有一个团队,其整个研究计划几乎被这次发布“抹掉”了。与此同时,曾处于OpenAI 早前纳维-斯托克斯问题争议中心的纽约大学数学家 Tristan Buckmaster 表示,他已经听说“有三个人整个研究计划被摧毁”。
在 The Verge 与数学家的交谈中,类似的故事反复出现,不过这种冲击主要集中在领域的某些方向。苏格兰赫瑞瓦特大学数学教授 Francesco Fournier-Facio 表示,概率论、组合学和理论计算机科学的研究者似乎“尤其震惊”,并补充说,他所在领域中的群论等部分已被“推平”。
Armstrong 和其他研究人员表示,一些领域似乎是以近乎军事级的精确度被瞄准的。“确实有一些目标,”Armstrong 说。他特别指出了 Wang 今年获得菲尔兹奖所涉领域的工作,以及几个千禧年大奖难题。他说,数学物理领域的一批成果清楚表明,OpenAI 正在研究 Yang-Mills 理论——支撑现代粒子物理学大部分内容的数学框架——及其未解决的“质量间隙”问题,这是七个大奖难题之一。
在其他地方,研究人员对自己工作似乎受到的影响之小,表现出一种惊讶的宽慰。Roney-Dougal 说,她自己所在的领域角落——主要围绕群论——似乎相对未受波及。她开玩笑说,幸好自己研究的是一个“非常不时髦的领域”,不过后来发消息说,在发现自己的作品被其中一篇论文引用后,她感到“不确定”。
Joshi 同样发现与自己工作的重叠很少,她的工作主要聚焦于可积系统,即可以精确求解的复杂系统。她提出,这可能是因为她的领域较少由长期存在、正式表述的猜想和定义驱动,而更多由随着物理学发展而起伏的问题驱动。
截至 10 月 8 日,该记录已经列出了大量更正,包括对十几篇手稿的修订,以及因一个“符号错误”而撤下三篇论文,该错误据称使一个论证无效。
无论他们自己的工作是否受到直接影响,大多数接受 The Verge 采访的数学家都感到,这个领域已经跨过了某种门槛,不再是一天前的样子。普林斯顿高等研究院研究员 Constantin Kogler 称其为“数学史上最重要的单一时刻”,而伦敦数学科学研究所研究员 Yang-Hui He 则回溯数千年,将今年 AI 驱动的发展比作欧几里得《几何原本》的出版,这是该学科最具影响力的著作之一。
很少有研究人员的评价如此宏大,但人们普遍认为,数学正在快速变化——数学家也必须随之改变。
OpenAI 知道这次发布将带来冲击,并做出了一些努力来缓和打击并与数学界接触。在今年早些时候与研究人员发生几次不愉快的交锋后,该公司转向数学家本人寻求帮助,与新成立的数学与人工智能咨询小组(AGMAI)合作,研究如何负责任地发布这些成果。
AGMAI 已经 阐明了它认为负责任的参与方式应该是什么样的。AI 实验室最好发布“人类能理解”的论文,或者以其他方式提供必要的“支持,以开展额外的数学活动,使人类能够理解和吸收其 AI 生成的数学成果,并识别其可能的应用”。他们表示,在可能的情况下,证明应当形式化,并且公司应当公开他们用来创建这些证明的模型和提示词。该组织还敦促 AI 实验室停止将数学成果发布当作“推广其模型的营销工具”,并应“停止在专有模型上测试高级数学问题”,因为这些模型对更广泛的科学界来说无法访问。
“并不是说这些只是没人听说过的无聊问题。其中许多都是非常著名的问题,很多人已经尝试了几十年。”
OpenAI 采纳了该组织的一些建议。它表示将围绕其在数学方面的工作资助一系列研讨会和会议,以帮助社区处理和理解其工作,不过它没有提供这些活动可能是什么样子或何时举行的细节。该公司还披露了比以往发布中多得多的信息——研究人员再次表示,这是一个很低的标准——包括其模型尝试了 4,000 多个问题,以及一个典型结果使用了大约三个小时的 ChatGPT Pro 思考算力。它还实施了“论文修订和引用协议”,并在 GitHub 上表示它“将保留该合集的公开发布历史”。截至 10 月 8 日,该记录已经列出了大量更正,包括对十几篇手稿的修订,以及因一个“符号错误”而撤下三篇论文,该公司称该错误使某个论证无效。OpenAI 没有就 The Verge 要求提供更多细节的请求作出正式回应。
这一变化解决了与数学家之间一个关键的摩擦来源,其中一些人谈到围绕该公司所发布声明存在一种“偏执”。该公司有习惯在回应批评时暗中修改新闻稿和论文,而不明确披露这些更改。
但 OpenAI 并没有遵循该组织的所有建议——包括一些最重大的建议。它没有说明此次发布背后的模型,也没有披露所使用的提示词或模型尝试过的完整问题集。OpenAI 似乎还承认其形式化工作有所欠缺——它表示将在获得更多形式化内容后补充——并且论文质量不达标,称“对于未来的发布,我们致力于通过引用、数学阐述和结果呈现来进一步提高论文质量,以便更好地理解。”
“我最了解的那个问题的文稿,快速读完后几乎说不通。”
The Verge 采访的研究人员质疑,为什么 OpenAI 不能提高这些论文的质量,并对该公司似乎懒得提前形式化——甚至在撤稿论文的情况下连检查都不做——许多结果表示失望。诸如所使用的提示词之类的信息,也会在减轻许多人认为的评估负担方面极其有用,因为该公司突然向他们抛出了大量材料。
最重要的是,该公司表示没有计划停止在数学问题上测试其模型,并且实际上暗示它认为这样做是一种必要之举。“我们希望直接赋予科学家最先进的能力,并正在努力负责任地发布产生这些结果的模型,”它在宣布最新结果时表示。“这就是为什么继续在数学和其他科学领域评估我们的内部前沿模型很重要,这样我们就能加速开发推动这些领域进步的工具。”
在 OpenAI 公布其成果后,AGMAI 称该发布是“第一步”,并再次呼吁公平获取算力和研究工具。更根本的是,该组织认为“数学研究的未来不能仅仅是理解 AI 实验室产生的结果。”
尽管 OpenAI 声称解决了数百个长期存在的问题,数学家们表示仍有大量工作要做。许多人估计,理解该公司刚刚发布的所有内容可能需要数学界花费数年时间。
Armstrong 将如此多新数学的突然涌现比作一次短暂的外星访问可能引发的骚动。“如果 AI 现在消失,就像外星人来到地球然后离开一样,我们会在接下来的 10 年里研究这些,试图理解一切。”
其中很多工作本身就令人兴奋。研究人员将不得不填补空白、提取有用的思想和联系,并将解决方案置于更广泛的数学背景中,所有这些通常与为人类产生解决方案相伴而行。“对于许多这些结果,相关专家非常关心这些解决方案,我相信他们能够消化并向更广泛的世界展示它们,”Lichtman 说。他认为,随着 AI 改变这些领域,涉及解释、验证和情境化结果的工作需要被更加重视。“作为一个社会,我们应该更多地奖励这些消化工作。”
可能还有大量数学工作留给人类去做。据他所知,Lichtman 说所有结果尽管“令人惊叹”,但都“来自现有的方法和技术”。它们填补了已知数学版图的部分空白,而不是创造全新的领域。“事实证明,可填补的空间比专家们之前知道的要多得多!”Lozano-Robledo 也附和这一观点:“它们都在以非常巧妙的方式使用现有技术。”
而现有的版图远非极限。“数学研究本质上是无限的,”Lozano-Robledo 说。“研究将继续下去。”伦敦研究所的 He 表示,他特别期待看到接下来会出现什么,并推测研究人员最终可能会创造新的思想,“甚至可能是新的数学领域”。
这些公司似乎准备立即向前推进,远在数学界有任何合理机会消化它们所产生的内容之前。
《The Verge》采访的数学家中,很少有人原则上反对 AI 产生新数学。事实上,许多人对此表示欢迎,并在不同程度上表示他们自己是 AI 工具的狂热用户。大多数不安针对的是构建这些工具的 AI 公司进入他们领域的方式。
看看 OpenAI 和其他 AI 实验室发布的数学成果,你会觉得研究数学基本上就是把问题从清单上一个个划掉。AI 实验室公布结果的方式也强化了这种印象:一场炫目的发布会、一份初步的文稿,剩下的就丢给数学家去弄明白并加以阐释。多位研究人员告诉 The Verge,这些公司似乎准备立刻转向下一个目标,而学界根本还没来得及合理消化他们产出的东西。
研究人员形容,这是对数学研究实际运作方式的贫乏理解。解答固然重要,但通往解答过程中的一切同样重要:发展想法、建立联系、发现新问题或开辟其他研究路径。当 OpenAI 这样的公司只是找到答案而不做任何周边工作时,数学家们说,这些工作的负担就落回了学界身上。
“有新结果当然是好事,但这个规模是另一个层级,”波兰波兹南密茨凯维奇大学的数学家 Bartosz Naskręcki 说。“这是一团大乱,”他说。“它可能导致学术文化的巨大崩塌,直接毁掉大多数院系。这是一个社会问题,而 AI 实验室似乎完全无视这个问题。”
需要数年才能理解的不仅仅是数学本身。研究人员也在艰难地理解这场剧变对他们意味着什么。许多人描述,随着数学家们试图弄清自己在快速变化的领域中处于什么位置,一种黯淡、近乎存在主义式的情绪笼罩着整个学界。他们可能没有多少时间去想明白。
数学家之间已经在流传关于 OpenAI 将进一步发布成果的传闻。对于是否还有更多发布计划,OpenAI 未回应 The Verge 的提问。
Roney-Dougal 说,她害怕又一次发布——或者 Anthropic 或其他 AI 实验室加入战局的前景。
这场冲击对博士生、初级研究人员以及其他没有终身教职的人打击尤为沉重。像 OpenAI 模型正在攻克的那些开放问题,可能支撑着博士论文、经费申请、求职材料以及多年规划的研究,这些都是学术生涯的重要基石。几位研究人员描述了一种日益弥漫的焦虑:他们赖以为职业根基的工作可能突然成为下一个目标,而 AI 模型在堵死一些路径的同时,几乎没有开辟出未来探究的新方向。“对于经费即将到期或正在找工作的人来说,这极具破坏性,”瑞士苏黎世联邦理工学院的数学家 Simon Machado 说,他即将加入法国国家科学研究中心(CNRS)。
“数学研究本质上是无限的。研究仍会继续。”
士气可能格外低落,因为一切都让人感到无休无止。OpenAI 的发现一波比一波大,中间几乎没有停顿,而且公司频繁暗示还有更多成果即将到来。“你能感觉到,他们并不真正在乎这些个别结果,”Roney-Dougal 说。“这种感觉真的很糟糕。”
数学家们还没来得及消化一组结果,下一组更大的结果就砸了下来。“再过两个月就会有东西把这一切彻底盖过去,”Armstrong 说。“就像是一轮又一轮越来越大的炸弹轰炸。”
Armstrong 说,他认为自己是对 AI 最热情、最乐观的数学家之一。他在自己的工作中使用这项技术,并相信它潜力巨大。但即便是他,也越来越感到不安。“晚上有点难以入睡,”他承认道。
当被问及接下来打算做什么时,Armstrong 不太确定。他仍在巴黎街头步行去吃午饭,他说自己眼下的首要任务是完成一些他一直在做的工作——有时是在 OpenAI 的 Codex 帮助下——“赶在 OpenAI 抢在我们前面之前。”
除此之外,就连这位自称的 AI 乐观主义者也不确定,并质疑自己在数学领域还有什么未来。他尤其担心该领域的年轻研究者。“数学界接下来几年会非常诡异,”他说道。
关注本报道的话题和作者,以便在您的个性化首页信息流中看到更多类似内容,并接收邮件更新。
- Robert Hart
来源:The Verge · AI · theverge.com