8月以来,美国Anthropic、OpenAI等AI企业凭借手中先进的大模型在前沿数学领域接连取得多项成果。Anthropic宣称研究版Claude模型在黎曼猜想上取得进展,其Fable模型仅用11天就完成了费马大定理的完整形式化证明。OpenAI则宣布GPT-6 Astra模型在有界素数间隔问题上取得新突破,其内部未公开模型仅88小时就解决了千禧年七大难题之一——纳维-斯托克斯问题。
然而,就在AI“狂飙突进”啃下一个又一个数学难题时,顶尖数学家们却举起了“警示牌”。9月11日,陶哲轩、邓煜等25位菲尔兹奖得主联名发布公开声明称,AI企业将攻克数学难题作为大模型性能基准的做法,对数学科学本身乃至整个数学界都造成了损害。
AI之于数学,究竟是解决难题的“神器”,还是带来伤害的“毒药”?数学界该如何应对AI带来的冲击,抓住AI带来的机遇?
完全依靠AI或将“污染”研究过程
数学家们在声明中写道,在许多领域和活动中,多年的训练不仅是为了得到最终答案或产品,更是为了培养理解力以及提出新问题和新想法的能力。
正如陶哲轩所说,在数学领域,大多数问题的提出并不是为了迫切得到答案,解决这些问题的过程会推动该领域进一步发展。他在社交媒体上用“剧透”形容AI企业对数学界带来的伤害——过早地完全依靠AI解决问题,可能会“污染”数学研究的过程,为数学的发展带来负面影响。
“很多数学难题的最终答案其实并不是这个难题最有价值的部分。”中国传媒大学数据科学与智能媒体学院副教授王传彪非常同意陶哲轩的观点。他告诉科技日报记者,经过350多年研究,费马大定理在1994年才被攻克,这段时间里人们绞尽脑汁寻找的破局方向、研究方法、数学工具比结果更有价值。
那么,AI在解决问题的过程中,会不会产生对数学有重要意义的“中间产物”?答案是,现阶段AI的表现还不尽如人意。
OpenAI号称解决了纳维-斯托克斯问题,并发布了长达166页的论文。布朗大学纳维-斯托克斯问题专家哈维尔·戈斯麦·赛拉诺认为,这篇论文不仅大模型生成痕迹明显、晦涩难懂,而且缺乏人机交互、思维链等重要的中间过程信息。8月,陶哲轩也在论文中提到,当前AI工具的解题过程相当不透明,那些内部运作机制属于企业机密的专有模型更是如此。
当然,AI对数学界的冲击并不止于“剧透”。北京大学北京国际数学研究中心博雅特聘教授董彬认为,AI可以大量生成候选证明和候选结论,但评估这些结果是否真正推进了数学理解,以及它们在知识体系中处于什么位置,仍然需要数学家来判断。因此,压力正在向评估和消化环节转移。
“如果候选结果的AI生成速度持续提高,评估和消化的工作越来越多,现有的学术评价机制就需要相应调整。这一点目前还没有很好的解决方案。”董彬说。
“AI正在导致数学界成果发表链条出现拥堵。”王传彪了解到,在某些具体方向上,大量使用AI获得的成果快速涌现,产出规模已远超审稿人同行评审的承载能力。同时,AI辅助研究也带来了公平性问题,AI工具的好坏、有无,使研究者不再处于同一起跑线上。
AI扩展数学家提出好问题的空间
AI应用于数学研究,带来的全是负面结果吗?答案或许并没有那么简单。
对于AI企业来说,用大模型破解数学难题,并非完全为了提高知名度或者抢数学家的“风头”,而是颇为符合技术逻辑的理性选择。
“数学是人类已知最精确的结构化推理体系,它恰好具备了一个对AI训练极为关键的属性——结果可以被程序自动验证。”董彬介绍,代码训练之所以能让AI变聪明,核心原因是它实现了结构化任务和自动反馈的闭环,简单说就是可以“做题—自动判分—改错”不断循环。数学把这套范式推向了更深的层级。以AI训练中常用的数学推理工具Lean 4中最大的数学库Mathlib为例,其概念依赖链深度可达84层,这种长链条推理是普通编程任务很少涉及的。
董彬总结道,AI企业选择用数学来训练和验证大模型,本质上是选了一个当前最干净的推理试验台,其根本目的还是提升模型能力。
AI在数学研究中的应用也给数学界带来了机遇。陶哲轩等数学家在声明中明确写道:“AI有望增强和加速真正的数学研究与理解。”
“机遇首先体现在数学家自己的日常研究中。”董彬说,学习一门自己不熟悉的数学技术,过去往往需要找到相应领域的专家当面请教,或者花很长时间从文献中摸索。现在借助AI,这个过程快了很多,跨领域学习的门槛正在下降。
王传彪对此也深有感触。他告诉记者,一个数学问题被人研究了上百年,可能完全进入了一个错误的研究路线,真正的解决思路反而被隐藏在其他数学方向中。事实上,很多被AI解决的数学难题,最后使用的方法也是早已被发现的数学工具,只不过这个工具属于其他研究方向。
“数学的概念空间极其巨大,已被人类探索过的部分只占很小一块。”董彬说,AI加速解决数学问题,不仅不会挤压数学家的空间,反而会打开新的结构和新的疑问,扩展数学家“提出好问题”的空间。
AI与数学家的关系仍待讨论
AI可以被用于数学研究,这没有什么争议。但应用AI到什么程度,既能加速数学发现、又能避免“剧透”,似乎还没有定论,不同数学家给出的观点也不尽相同。
“有正确思路、需要组织已有技术沿着思路快速推进的数学问题,特别适合AI来‘暴力’破解。但没有思路、需要构建新的数学框架,或者核心工具缺失的问题,AI现在还搞不定。”在董彬看来,数学研究中真正稀缺的能力从来不只是解决问题,而是提出好问题、判断什么方向值得走。这目前仍然主要依靠人的判断。
例如,OpenAI在公告中刻意突出大模型、智能体在证明纳维-斯托克斯问题上的作用。但事实上,这一过程中无论是目标题目还是解题路线的选择,都是数学家团队作出的决定。
今年5月,菲尔兹奖得主阿克谢·文卡特什等学者发文称,AI正在重新定义数学学科的本质,并鼓励所有读者积极参与AI与数学的话题讨论。9月,陶哲轩在社交媒体上称,为了维护某些数学问题对数学生态系统的更广泛价值,或许有必要禁止AI处理某些类型的数学问题。
董彬赞成数学界应对使用AI的规则开展广泛讨论。他倾向于讨论的落点聚焦于研究成果的评价标准上,而不是先去划定哪些问题不许用AI。
“是否限制AI的使用要分两种场景谈。”董彬说,数学教育领域的限制是必要的,AI不能代替学生完成思考。在科研领域,评判研究的标准则要看其是否推动了数学的进展。至于研究者用了什么工具并不是关键,但透明是必要的,用了AI就要在论文里如实说明用在哪一步、起了什么作用。
最近,OpenAI首席执行官萨姆·奥尔特曼公开宣布,该公司内部模型能够做到世界上最顶尖数学家都无法做到的事。看来,关于数学与AI之间的讨论,还会持续下去……
特别声明:本文转载仅仅是出于传播信息的需要,并不意味着代表本网站观点或证实其内容的真实性;如其他媒体、网站或个人从本网站转载使用,须保留本网站注明的“来源”,并自负版权等法律责任;作者如果不希望被转载或者联系转载稿费等事宜,请与我们接洽。