OpenAI批量发布AI数学手稿引学界核验争议

OpenAI批量发布AI数学手稿引学界核验争议

财π新闻 10月6日,OpenAI对外发布了由其内部前沿模型生成的722篇数学研究手稿,相关成果被统一收录在公开的GitHub代码仓库中,按照结果相关性划分为372个“结果家族”,覆盖数论、代数几何、理论计算机科学、几何、数学物理等17个数学研究领域,其中涉及准黎曼猜想相关等重要数学问题,共有162篇手稿附有Lean形式化证明。OpenAI方面表示,单次成功生成一项有效数学结果,平均消耗的算力相当于ChatGPT Pro连续思考3小时的算力,整个评估过程中,内部模型累计尝试解答了约4000个数学问题。

这批手稿的公开内容包含论文PDF、配套证明材料、Lean形式化文件,以及10份模型推理过程的删节摘要,同时配套设置了论文修订和引用规范,所有历史版本均可公开访问。OpenAI方面称,后续还会持续更新代码仓库,补充更多完成的Lean形式化证明内容,同时将资助一系列相关研讨会、学术会议和专项活动,帮助数学界理解这批AI生成的重大数学成果。

此前纳维—斯托克斯难题相关争议持续发酵

早在9月8日,OpenAI就曾宣称其耗资巨大的万智能体系统已经解决了纳维—斯托克斯千禧年难题,这一消息随即在全球数学界引发轩然大波,同时也引发了与纽约大学数学家特里斯坦·巴克马斯特的优先权争议。巴克马斯特公开表示,他怀疑自己此前输入AI的私人未发表研究思路被不当窃取,而OpenAI方面对此予以否认,称没有核查过特定用户的私人数据,也无法完全排除用户产生的去标识化数据曾帮助改进模型的可能性。

由菲尔兹奖得主等顶尖数学家组成的独立顾问小组,对OpenAI此次使用未公开专有模型生成数学成果的做法提出公开批评,要求OpenAI完整公开所使用的模型、提示词和全部计算细节,保障学术研究的可复现性。但OpenAI方面并未满足这一要求,仅对外公布了平均计算时间这一项相关数据。麻省理工学院等多家机构的数学家公开强调,在缺乏可复现证据的前提下,OpenAI宣称单次解决重大数学问题的相关说法,应当被学界视为未经证实的内容,不能直接作为已确认的学术成果被引用。

形式化验证的固有局限引发学界普遍质疑

不少参与核验的数学家指出,OpenAI此前公布的纳维—斯托克斯难题相关方案中,对应的论文文本与配套的Lean代码存在多处不一致的情况,这直接引发了学界对这批AI生成手稿有效性的广泛质疑。Lean作为一种支持计算机自动核验数学证明的编程语言,仅能验证推导过程的逻辑形式不存在错误,完全无法判断最终得出的结果是否真正对应原始待解决的数学难题,也无法判定相关结论是否具备学术层面的创新性。

这也就意味着,在没有人类数学家逐篇完成人工核验的前提下,外界完全无法确认这批AI生成的数百份证明是否全部正确有效。此前有独立研究者对拟黎曼猜想相关的Lean证明完成了重检,确认该份证明通过了双内核核验,但其余绝大多数手稿的形式化验证工作仍处于未完成状态,大量手稿尚未经过任何独立的第三方核验。

AI批量产出成果引发数学界验证能力危机

AI短时间内批量生成大量数学手稿的现状,直接制造了“证明过剩危机”,全球数学界的现有验证能力已经严重滞后于AI的产出速度。面对一夜之间集中产出的700多篇手稿,人类数学家根本缺乏足够的时间逐篇完成消化理解,原本需要几代人逐步维护的数学知识网络验证流程,被AI的高速产出极度压缩,大量未经证实的工作直接被倾倒给了本就人手有限的数学研究群体。

不少深耕单一数学领域数十年的学者表示,AI短时间内攻克自己研究多年的未解决问题,完全打破了过往数学研究的常规节奏。伦敦大学学院的弗朗西斯·约翰逊研究沃尔D(2)问题长达25年,甚至为此撰写了两本相关著作,最终选择放弃该方向研究,他坦言AI快速攻克该问题的结果让自己十分意外,整个数学界都需要逐步适应AI带来的全新研究环境。帝国理工学院的凯文·巴扎德则提醒学界应当保持审慎,他所研究的数论领域共有30篇相关手稿,其中仅有7篇看起来质量突出,最终只有1篇通过了Lean形式化验证。

数学科研的核心重心正在发生根本性转变

陶哲轩等数学家在《人工智能与数学的严重错位》中明确指出,AI的普及正在彻底改变数学活动的整体重心。当生成具体数学答案的成本变得极度廉价之后,数学科研领域最稀缺的能力已经转变为判断什么内容值得研究、理解结果背后的深层意义,以及提出真正有价值的好问题,而数学研究更为重要的目标始终是概念理解与知识传承,绝非单纯批量产出待验证的证明结果。

不少顶尖数学家联名发布的公开声明中也强调,将解题作为评测竞赛、忽视概念理解与知识传承的做法,完全偏离了数学研究的核心初衷。过往数学结论获得学界公认需要经过完整的同行评审流程,由领域内专家逐页核查论证细节、反复沟通修改后才能正式发表,这套流程虽然耗时漫长,但能保证最终被纳入知识体系的每一项结果都足够严谨可靠,而AI批量产出手稿的发布方式,正在悄然改变数学成果的认定规则,相关影响仍有待整个学界共同应对。

(编辑:徐松丽)