跳到正文
The Verge · AI· Robert Hart·· 2 小时前精选AI 评分78

OpenAI 一口气放出近 400 项 AI 生成数学成果,数学家称需数年才能消化

‘Pure insanity’: Mathematicians will need years to make sense of OpenAI’s latest drop

AI 导读

OpenAI 本周以 700 多份手稿发布近 400 项 AI 生成的数学结果,覆盖组合数学、几何、数论等众多领域,其中约 42%(719 篇中 300 篇)已在 Lean 中形式化。

推荐理由

文章汇集多位数学家的一手评价,既指出部分成果可达顶刊水准,也呈现验证缺位与学术生涯受冲击的具体代价。

正文 · AI 翻译

“惊人。”“压倒性。”“前所未有。”“超现实。”“纯粹的疯狂。”

这些是三十多位数学家在与《The Verge》交谈时用来形容 OpenAI 本周突然向数学界抛出的大量数学成果的词语。在对这场规模空前的研究洪流的敬畏、兴奋和不确定之中,隐藏着一种深层的焦虑:这一切意味着什么——接下来会发生什么。尽管反应各不相同,研究人员一致认为,仅仅是理解 OpenAI 发布的内容就可能需要数年时间,更不用说弄清数学家们自身在这个正在变化的领域中的位置了。许多人担心 OpenAI 不会等那么久就会继续前进——或者发布更多的成果。

OpenAI 总共发布了近 400 项 AI 生成的成果,分布在 700 多份手稿中,涵盖众多数学学科,包括组合数学、几何学的多个分支、数论、理论计算机科学、代数、拓扑学、概率论与统计力学,以及数学物理。这批成果规模如此庞大,以至于 OpenAI 觉得有必要就如何在庞大的 GitHub 仓库中导航发布指南。

如此庞大的工作量使得对该公司究竟发布了什么做出哪怕初步的评估都十分困难。在成果发布后的数小时和数天里,大多数《The Verge》交谈过的数学家表示,他们仍在努力消化这些内容;有几位说,仅仅是通读大约 40 页的目录和摘要就花了他们将近一个小时。“光是过一遍全部摘要就已经让人应接不暇,”康涅狄格大学数学教授 Álvaro Lozano-Robledo 说。

散布在数百份手稿中的,还有用 Lean 形式化的成果。Lean 是一种编程语言和证明助手,可以让结果通过计算来验证。这些形式化在评估 OpenAI 之前的数学声明时被证明非常有用,让研究人员即使不完全理解其背后的论证,也能确信某个声明在逻辑上是正确的。

“如果 AI 现在消失,就像曾经来到地球然后又离开的外星人一样,我们接下来会用 10 年时间来研究这些内容,试图理解一切。”

但每个结果被验证的程度差异巨大。在 GitHub 上,OpenAI 承认这些结果“处于不同的验证阶段”,并且“许多——但并非全部——手稿已经完成了形式化”。截至撰稿时,这批手稿中似乎只有不到一半经过了正式描述。OpenAI 表示,719 份手稿中只有 300 项核心结果完成了形式化,约占 42%,并且“随着获得更多形式化结果,我们会更新该仓库”。

多位数学家向《The Verge》抱怨这种形式化的缺失,尤其是考虑到成果数量之巨,并强调即便成果附带 Lean 代码,评估也不是即时完成的。研究人员必须检查形式化是否真的证明了成果所声称的内容,这又是一个耗时的过程。几位仔细研读论文的人士表示,即使提供了可由计算机验证的证明,其质量也不一致,而且所验证的命题并不总是能与随附手稿中的主张清晰对应。

伦敦帝国理工学院数学教授 Kevin Buzzard 表示,他在自己的研究领域——代数数论——中发现了大量定理,其中只有大约六个“一眼可见”是可靠的。这些定理中似乎鲜有经 Lean 形式化验证的。“因此,我要么得去阅读可能不正确的低质内容,要么等别人去读,要么等有人将其形式化之后,我才能确信这些结果是否正确。” Buzzard 的担忧得到了众多其他研究者的响应。

担心 AI“低质泛滥”(slop)的远不止 Buzzard 一人。这个词是对日益在网上——乃至在现实世界中——包括学术论文里大量涌现的低质量、频繁出错的 AI 生成内容的简称。与其他领域一样,数学家们告诉《The Verge》,近年来他们看到借助 ChatGPT 和 Claude 等工具生成的此类内容激增。其中很多内容令人困惑、难以阅读,且几乎不体现对学科的理解;在署名致谢其他研究者方面尤其糟糕。

OpenAI 之前的数学成果报告曾因粗制滥造而受到专家的广泛批评,尤其是其引用不当或完全缺失引用。在成果发布前与《The Verge》的交流中,几位研究者已开始把即将到来的论文洪流称作“低质末日”(slopocalypse)或类似的变体说法。

令人担忧的“低质末日”是否真的成为现实,很难说清,这在很大程度上是因为发布材料数量之巨令人眼花缭乱。早期迹象表明,OpenAI 这次对论文更加用心了,或者至少对其中一部分是如此。几位数学家告诉《The Verge》,他们的第一印象远好于预期,不过他们也承认,鉴于该公司此前粗制滥造的发表记录,这 hardly 是什么高标准。

“这是一团大乱局。它可能导致学术文化的巨大崩塌,并直接扼杀大多数院系。这是一个社会问题,而 AI 实验室似乎完全无视这一问题。”

但更好并不一定意味着好,更遑论达到对提出如此重大主张的学术工作通常所要求的水准。在 OpenAI 的许多主张缺乏形式化验证的情况下,随附论文的质量就显得尤为重要;它们是数学家确认、理解、审视这些成果并将其置于背景之中的主要途径。

即使在最好的条件下,撰写严谨的数学论文也是一项艰难的工作。以这种规模来完成更是一项艰巨的任务。OpenAI 的模型正以惊人的速度、横跨广泛的专业领域产出数学成果,远远超出了其人类员工的能力。该公司根本没有足够广博的专业知识或资源来恰当审视其处于数学前沿的发现。研究人员告诉 The Verge,这一点显而易见。

许多人描述说,这些论文难以读懂,有时几乎不可能读懂。“我所最熟悉的那篇问题的论文,快速读了一遍后感觉不知所云,”布朗大学数学教授 Brendan Hassett 告诉 The Verge。“如果这是一个人写的,我就不会再花时间试图理解它了。当然,这还剩下 721 篇其他预印本呢!”(Hassett 是在 OpenAI 撤回三篇论文之前说这番话的)。

一些研究人员告诉 The Verge,他们或其同事注意到的几篇论文似乎涵盖了其他数学家已经涉足过的领域,不过在有机会恰当审阅这些材料之前,他们不愿公开这么说。还有人指出这些工作篇幅异常简短,通常需要数百页展开的结果被压缩到几十页甚至更少。

澳大利亚悉尼大学数学教授 Nalini Joshi 表示,她快速检索后发现这批发布中几乎没有与她自己的工作重叠的内容,但她指出她查看的一些论文“参考文献列表很短”。鉴于此前对 OpenAI 署名做法的批评,她表示她“担心论文中的归属可能没有反映完整的情况”。

尽管存在这些粗制滥造和不确定性,总体共识是这批发布中包含一些确实令人印象深刻的工作。

在强调评估如此大量材料的困难——以及恰当验证结果的必要性——的同时,The Verge 采访的众多研究人员表示,这些工作尽管在呈现上存在缺陷,但似乎水平非常高。他们说,在 AI 出现之前的世界,OpenAI 的许多成果显然足以发表在顶级期刊上,甚至足以为作者奠定学术生涯。有少数几篇被形容为能让一位数学家成为菲尔兹奖——该学科最高荣誉之一——有力竞争者的那种工作。

“我要么得去读可能并不正确的粗制滥造之作,要么等别人也这么做,要么等有人把它们形式化之后,我才能确定这些结果是否正确。”

斯坦福大学数学家 Jared Duker Lichtman 表示,有“数十项”结果属于这一类别,包括在黎曼猜想上的进展、霍奇猜想的一个特例,以及四维挂谷猜想的解法。这些都是数学界的重大问题。黎曼猜想——可以说是整个学科中最臭名昭著的未解难题——和霍奇猜想都位列著名的七大千禧年大奖难题之中。前者关注素数的分布,后者大致上是关于如何用更简单的构件来理解复杂的几何形状。而挂谷猜想大致上问的是:需要多小的空间才能把一根针或一支铅笔旋转到每个方向。挂谷猜想三维版本的证明是纽约大学数学家王虹今年早些时候被授予菲尔兹奖的成就之一。

“这些并不是那种从没人听说过的无聊问题,”数学家 Scott Armstrong 说,“其中许多都是众所周知的难题,很多人已经尝试了几十年。”

当尘埃渐渐落定,数学家们发现自己面对的是一片骤然改变的图景。许多人刚刚目睹自己多年的工作和精心制定的研究计划在一瞬间化为乌有,或者知道有同事经历了这样的遭遇。在整个领域,无论反应中掺杂着兴奋、恐惧、绝望,还是介于两者之间的情绪,人们都感到深深的迷失。

到第二天早上,这种情绪并没有太大改变。Armstrong 在巴黎街头边走边接受电话采访时设想,如果索邦大学没有因持续的学生抗议而关闭,他的同事们围坐在平日那台咖啡机旁,气氛本会相当“凝重”。

在苏格兰,圣安德鲁斯大学数学教授 Colva Roney-Dougal 描述了同事和学生之间类似的阴郁气氛。这场信息洪流让她感到有些“可怕”,但它的到来在数周的不确定之后也带来了一些解脱。“我有一大堆朋友和同事,他们的研究经费申请就这样被清零了,”她说。

“我有一大堆朋友和同事,他们的研究经费申请就这样被清零了。”

Armstrong 说,他知道有一个小组的整个研究计划几乎被这次发布“彻底摧毁”。曾处于 OpenAI 早前围绕纳维-斯托克斯问题争端中心的纽约大学数学家 Tristan Buckmaster 则表示,他已经听说有“三个人的整个研究计划被抹掉了”。

在《The Verge》与数学家的交谈中,类似的故事反复出现,尽管这种冲击主要集中在领域的某些方向上。苏格兰赫瑞-瓦特大学数学教授 Francesco Fournier-Facio 说,概率论、组合数学和理论计算机科学领域的研究者“尤其震惊”,并补充说,他所研究的群论领域的某些部分已被“碾平”。

Armstrong 和其他研究人员表示,某些领域似乎遭到了近乎军事级精度的瞄准。“确实存在一些目标,”Armstrong 说。他特别点名了 Wang 今年获得菲尔兹奖的研究方向,以及几个千禧年大奖难题。他说,数学物理领域的一批结果表明,OpenAI 显然正在攻克杨-米尔斯理论——支撑现代粒子物理学大部分内容的数学框架——及其尚未解决的“质量间隙”问题,这是七个大奖难题之一。

在其他地方,研究人员对自己的工作似乎几乎未被触及表示出一种惊讶的宽慰。Roney-Dougal 说,她自己所在的研究角落——主要集中于群论——似乎相对安然无恙。她开玩笑说,幸好自己工作在一个“非常不时髦的领域”,不过她后来发消息说,在发现其中一篇论文引用了她的工作后,她感到“不确定”。

Joshi 同样发现她的工作几乎没有重叠,她的研究主要集中在可积系统——能够被精确求解的复杂系统。她认为,这可能是因为她的领域较少受长期存在的、正式表述的猜想和定义驱动,而更多受随物理学进展而兴衰的问题驱动。

截至 10 月 8 日,该记录已列出了大量更正,包括对十几份手稿的修订,以及因一个据称使论证无效的“符号错误”而撤下的三篇论文。

无论自己的工作是否受到直接影响,接受《The Verge》采访的大多数数学家都有一种感觉:这个领域已经跨越了某种门槛,不再和一天之前一样了。高等研究院的研究员 Constantin Kogler 称其为“数学史上最重要的单一时刻”,而伦敦数学科学研究所的研究员 Yang-Hui He 则回溯千年,将今年 AI 驱动的进展与欧几里得《几何原本》的出版相提并论,后者是该学科最具影响力的著作之一。

没有多少研究者给出如此宏大的评价,但普遍的共识是:数学正在快速变化——而数学家们也必须随之改变。

OpenAI 知道这次发布将带来冲击,并已做出一些努力来减轻打击并与数学界展开交流。在今年早些时候与研究人员发生数次不愉快的摩擦之后,该公司转而向数学家们寻求帮助,与新成立的数学与人工智能咨询组(AGMAI)合作,探讨如何负责任地发布这些成果。

AGMAI 已经 阐明了它认为负责任的发布方式应该是什么样的。AI 实验室理应发布“人类能够理解的”论文,或者提供必要的“支持,以帮助人类完成理解并消化其 AI 生成的数学成果、并识别其可能应用所需的额外数学活动”。他们表示,在可能的情况下,证明应当被形式化,公司应当公开它们使用了哪些模型和提示词来创建这些成果。该组织还敦促 AI 实验室不再把数学成果发布当作“推广其模型的营销工具”,并应“停止在私有模型上测试高等数学问题”,因为这些模型是更广泛的科学界无法访问的。

“这些并不是一些没人听说过的小破题。其中很多是非常著名的问题,许多人都尝试了几十年。”

OpenAI 采纳了该组织的一些建议。它表示将为围绕其数学工作的一系列研讨会和会议提供资助,以帮助社区消化和理解其工作,但没有提供这些活动可能的形式或时间的细节。该公司还披露了比以往发布时多得多的信息——研究人员再次表示,这是一个很低的门槛——包括其模型尝试了超过 4,000 个问题,以及一个典型结果大约使用了三个小时的 ChatGPT Pro 思考算力。它还实施了“论文修订和引用的规程”,并在 GitHub 上表示将“保留该合集的公开发布历史”。截至 10 月 8 日,该记录已列出大量更正,包括对十几篇手稿的修订,以及因一个据称使论证失效的“符号错误”而撤下三篇论文。OpenAI 没有在记录中回应 The Verge 请求更多细节的问题。

这一改变解决了与数学家之间摩擦的一个关键来源,其中一些数学家谈到围绕该公司已发表声明的一种“偏执”。该公司已经表现出一种 习惯:在受到批评后悄悄修改新闻稿和论文,而不明确披露这些改动。

但 OpenAI 并没有遵循该组织的所有建议——包括其中一些最具分量的建议。它没有指明这次发布背后的模型,也没有披露所使用的提示词或模型尝试过的完整问题集。OpenAI 似乎也承认其形式化工作有所欠缺——它表示会在获得更多内容时补充进去——并且论文质量欠佳,称“在未来的发布中,我们致力于通过引用、数学阐述以及结果的呈现方式进一步提升论文质量,以便更好地理解。”

“我对自己最了解的那个问题的表述,快速读了一遍之后觉得几乎讲不通。”

The Verge 采访的研究人员质疑 OpenAI 为什么不能提升这些论文的质量,并对它似乎不愿提前对许多结果进行形式化——或在撤回论文的情况下甚至不予核查——表示失望。诸如所用提示词之类的信息本也会极其有助于减轻许多人感到的那种负担,即评估该公司突然抛给他们的海量材料。

最重要的是,该公司表示没有计划停止在数学问题上测试其模型,甚至暗示认为这样做是必须的。“我们希望用最先进的能力直接赋能科学家,并正在努力负责任地发布产生这些结果的模型,”该公司在公布最新结果时表示。“这正是为什么继续在数学和其他科学领域评估我们内部的前沿模型非常重要,这样我们才能加速开发推动这些领域发展的工具。”

在 OpenAI 公布其结果后,AGMAI 将 这份成果称为“第一步”,并重申了对公平获取算力和研究工具的呼吁。更根本的是,该组织认为“数学研究的未来不能只包含理解 AI 实验室产出的结果”。

尽管 OpenAI 声称解决了数百个长期存在的问题,数学家们表示仍有大量工作要做。许多人估计,要消化该公司刚刚发布的所有内容,可能需要整个学界数年时间。

Armstrong 将如此多新数学成果的突然到来比作外星人短暂造访后可能引发的骚动。“如果这些 AI 现在消失,就好像外星人来到地球然后又离开了,我们会用接下来的 10 年来研究这些,试图理解一切。”

其中很多工作本身就令人兴奋。研究人员将不得不填补空白、提取有用的想法和联系,并将解答置于更广阔的数学背景中——这些通常都是为人类产出解答时相伴而生的工作。“对于其中许多结果,相关专家非常关心这些解答,我相信他们能够消化并向更广泛的世界展示它们,”Lichtman 说。他认为,随着 AI 改变这些领域,涉及解释、验证和 contextualize 结果的工作需要受到更多重视。“作为一个社会,我们应该更多地奖励这些消化工作。”

也有很多数学工作留给人类去做。据他所知,Lichtman 说所有这些结果虽然“令人惊叹”,但都“来自现有的方法和技术”。它们填补了已知数学版图的一部分,而不是创造全新的版图。“事实证明,有比专家们以前所知的更多的空间可以填补!”Lozano-Robledo 也表达了同样的观点:“他们都在以非常巧妙的方式使用现有技术。”

而且现有的地图远非极限。“数学研究本质上是无限的,”Lozano-Robledo 说。“研究会继续下去。”伦敦研究所的 He 说他特别期待接下来会出现什么,他推测研究人员最终可能会创造新的想法,“甚至可能创造新的数学领域。”

这些公司似乎准备立即转向下一步,远在学界有任何合理机会消化它们产出的成果之前。

《The Verge》采访的数学家中,很少有人从原则上反对 AI 产生新的数学成果。事实上,许多人对此表示欢迎,并在不同程度上表示他们本身就是 AI 工具的热情用户。大多数不安情绪针对的是那些构建这些工具的 AI 公司进入他们领域的方式。

看着 OpenAI 和其他 AI 实验室发布的数学成果,你很容易以为研究数学本质上不过是把问题从清单上逐个划掉。AI 实验室公布结果的方式更是强化了这种印象:一场华丽的发布会,一份初步的文稿,剩下的就丢给数学家们去弄明白并加以解读。多位研究人员告诉 The Verge,这些公司似乎急于立刻转向下一个目标,远在社区有机会合理消化它们产出之前。

研究人员称,这是对数学研究实际运作方式的一种贫乏理解。解当然重要,但寻找解的过程同样重要:发展思想、建立联系、提出新问题或开辟其他研究路径。数学家们表示,当 OpenAI 这样的公司只给出答案而不做任何相关的外围工作时,做这些工作的负担就落回了社区身上。

“有新成果固然好,但这个规模是另一个量级,”波兰波兹南密茨凯维奇大学的数学家 Bartosz Naskręcki 说。“这是一团大乱局,”他说。“它可能导致学术文化的巨大崩塌,甚至直接扼杀大部分院系。这是一个社会问题,而 AI 实验室似乎完全无视这个问题。”

需要花多年时间才能理解的不仅是数学本身。研究人员还在努力理解这场动荡对他们意味着什么。许多人描述了一种阴郁的、近乎生存危机的情绪笼罩着整个社区,因为数学家们正在弄清自己在这个急剧变化的领域中的位置。他们可能没有多少时间去想清楚。

数学家中间已经流传着 OpenAI 将发布更多成果的传言,而 OpenAI 没有回应 The Verge 关于是否还有更多发布计划的问题。

Roney-Dougal 说,她害怕再来一次轰炸式发布,也害怕 Anthropic 或其他 AI 实验室加入战局。

这场冲击对博士生、初级研究员以及其他没有终身教职的人打击尤其沉重。像 OpenAI 的模型正在攻克的那类开放问题,可能支撑着博士论文、基金申请、求职材料以及多年的研究计划,而这些都是学术生涯的重要基石。多位研究人员描述了一种日益普遍的焦虑:他们赖以建立职业生涯的工作可能突然成为下一个目标,而 AI 模型在关闭其他研究路径的同时,几乎没有为未来的探索留下多少途径。“对于一个资助即将到期或正在找工作的人来说,这具有极强的破坏性,”即将加入法国国家科学研究中心(CNRS)的瑞士苏黎世联邦理工学院数学家 Simon Machado 说。

“数学研究本质上是无穷的。研究会继续下去。”

士气可能格外低落,因为一切都让人觉得没有喘息之机。OpenAI 的成果以越来越大的浪潮接踵而至,之间几乎没有停顿,而且该公司频繁暗示还有更多成果在路上。“你会感觉他们并不真正在意这些单独的结果,”Roney-Dougal 说。“这种感觉真的很糟糕。”

数学家们几乎来不及消化一批结果,下一批更大的结果就砸了下来。“再过两个月就会有什么东西把这一切都比下去,”Armstrong 说。“这就像是一颗颗越炸越大的炸弹接连轰炸。

Armstrong 说,他认为自己属于对 AI 最热情、最乐观的数学家之列。他在自己的工作中使用这项技术,并相信它有巨大潜力。但连他也越来越感到不安。“晚上有点难以入睡,”他坦言。

当被问及接下来打算做什么时,Armstrong 不太确定。他仍在巴黎的街头行走,准备去吃午饭,他说他眼下的首要任务是完成他一直在做的一些工作——有时借助 OpenAI 的 Codex——“趁 OpenAI 还没把我们甩在后面。”

除此之外,连这位自称的 AI 乐观者也感到迷茫,并质疑自己在数学界还有怎样的未来。他尤其担心该领域的年轻研究人员。“数学界接下来几年会非常奇怪,”他 说。

关注本文的话题和作者,以便在您的个性化主页信息流中看到更多类似内容,并接收邮件更新。

  • Robert Hart

来源:The Verge · AI · theverge.com