AI攻克数学难题:Erdős猜想80年悬案被OpenAI破解背后的变革

0 阅读

2026年5月20日,整个数学界为之震动的消息传来:OpenAI宣布其尚未公开的AI模型成功推翻了匈牙利数学家Paul Erdős在1946年提出的一个重要猜想。这不仅是AI首次在数学领域产出具有历史意义的证明,更是在一个困扰数学界长达80年的经典问题上找到了前所未有的反例。这一突破标志着人工智能在理论科学领域迈出了关键一步,彻底改变了人们对AI能力边界的认知。

图片

几周之内,人类数学家基于AI提供的思路实现了进一步改进。仅仅几天时间,相关技术就被应用于解决其他重要的数学问题。8月1日,OpenAI再次宣布其名为Astra的模型一口气拿下了10项数学进展,其中包括Erdős提出的另外三个悬而未决的问题。普林斯顿大学的Noga Alon,一位在数十年职业生涯中亲自解决过数十个Erdős问题的数学家表示,这些模型正在极大地改变数学研究的方式。

图片

Paul Erdős是历史上最多产的数学家之一,一生发表了超过1500篇论文,与500多位合作者共同工作。然而,他最引人注目的并非产出数量,而是独特的生活方式。他没有固定住所,没有稳定工作,几乎一无所有,拎着一只手提箱在朋友家中辗转,从一个大学漂泊到另一个大学。他将大部分收入捐赠出去,财务由朋友代为管理。他只穿丝绸衣物,避免身体接触,对权威深感不信任,甚至将上帝称为最高法西斯。通过持续摄入安非他命来维持源源不断的数学创造力,他还有一个特殊习惯:到处抛出数学问题,并在旁边标注金额奖励——10美元、25美元,有时甚至数千美元,第一个解决问题的人可以获得相应报酬。

图片

1996年,Erdős在华沙参加数学会议时因心脏病发作去世,但他的问题并未随之消失。爱荷华州的一个非营利基金会承诺继续兑现他的悬赏。如今,这些问题的解决方案正在以另一种货币来衡量——每个问题消耗的token数量。一个反权威的流浪者留下的遗产,竟然成了世界上最强大科技公司的公关武器。

图片

如果没有英国数学家Thomas Bloom,这一切可能不会发生。Bloom在曼彻斯特大学研究算术组合学,从小就欣赏Erdős的风格,但一直面临困扰:Erdős的问题分散在各处,哪些已解决、哪些仍悬而未决,根本无法理清。2023年初,他决定将这些问题尽可能收集到一个列表中。起初只是自用,但为了便于随时访问,他创建了erdosproblems.com网站。有趣的是,编写这个网站的Python代码时,他使用了ChatGPT。那时,大语言模型能协助编写网站已属不易,用它进行数学研究还是遥不可及的梦想。

图片

Bloom不仅收集问题,还仔细梳理每个问题最合理的版本,因为Erdős有时表述问题的方式较为模糊。他不断添加内容,受众逐渐扩大。到2025年8月,他已经编目了近1000个问题。随后他做了一件看似微不足道却意义重大的事情:添加了评论区。从此,一个真正的社区得以建立。

图片

评论区里发生的事情堪称互联网普世价值的最佳体现。无论你是否有终身教职,是否在顶尖大学任职,甚至是否是数学家——只要拥有好想法,就能找到合作伙伴。Wouter van Doorn是网站上第四活跃的评论者,他的正式工作是为一家被其他公司雇佣提供客户服务支持的公司工作。尽管他十年前差点在比利时鲁汶大学完成数学硕士学位,但并非传统意义上的数学家。

2024年,看到大语言模型能力的飞速增长,他请假六个月专心从事数学研究。当时的想法是:现在我仍然比AI更擅长数学,但不知道一年后、两年后、五年后会如何变化。如果想完成这些项目,现在就是最佳时机。2025年10月,van Doorn在Erdős问题1102的页面下留下第一条评论。11月初,他不依赖AI找到了一些进展,并在评论区分享。

当天晚些时候,有人回复指出其论证中的缺陷。两人迅速交流,van Doorn成功说服了对方。对方回复道:现在我明白你的论证了,真漂亮!这位数学家正是陶哲轩,加州大学洛杉矶分校教授。陶哲轩与Erdős的渊源可以追溯到他10岁时——那时他曾见过Erdős本人。2015年,他与Polymath5项目的合作者一起解决了Erdős偏差问题,赢得了500美元奖金。

2025年夏天,Kevin Barreto和Liam Price在一个AI爱好者Discord服务器上成为朋友。Barreto在剑桥读本科,Price学过一些数学但中途离开。12月,他们确信最新AI模型能够解决某些Erdős问题,开始批量向模型输入问题。

他们很快发现了技巧:如果直接告诉GPT-5.2这个问题无人解决,模型进展甚微。但如果换种说法,让模型以为问题比实际情况更容易,效果就会显著提升。圣诞节早晨,Barreto在网站上发布证明,声称这是LLM完全自主解决Erdős问题的首个案例。

几小时后,有人指出:Erdős本人在1977年论文中已给出答案。Barreto坦率承认错误,并写道:我正式请求网站所有成员更加重视对目前标记为未解问题的文献检索。作为一个已两次犯此错误的人,这相当令人沮丧。但他们并未放弃。2026年1月4日,他们使用GPT-5.2 Pro解决了另一个问题Erdős 728,这次确实无人能找到已有证明。Barreto还使用名为Aristotle的AI工具验证逻辑成立。

Price摸索出一套方法论:先让AI给出解法,然后将解法输入新的AI实例进行检查,反复迭代,直到获得看似可行的方案。这实际上与许多公司内部做法相同——他们称之为harness或scaffold,只是Price手工完成了整个过程。

这里存在微妙问题。按Price自己的评估,他没有足够数学功底验证AI给出的最终解法是否正确,需要寻找真正懂行的人把关。在Barreto帮助下,他们找到了合适人选。Price和Barrett最终成为陶哲轩、斯坦福Jared Duker Lichtman等人2026年5月发表论文的共同作者——该论文解决了一个更重要的Erdős问题。

Bloom对此表示担忧。他认为AI被许多非数学家大量使用,这些人没有深厚数学背景,也无法验证输出结果。他们追求推进速度,让AI进行核验,成果规模不断扩张。如今看到越来越多100到200页的论文,声称解决了某个定理,AI生成证明、检查证明并撰写论文,但没有人类阅读,也不会去读。

2026年初,大公司开始入场。1月,Google DeepMind一个24人团队使用Gemini系统性评估Bloom数据库中700个标记为开放的猜想,解决了其中4个,还找到9个被遗忘的旧解答。5月,DeepMind另一个21人团队宣布解决了353个问题中的9个,每个问题成本为几百美元。

然后是5月20日的关键时刻。OpenAI宣布找到单位距离问题的反例。这个问题表述简单:如果在平面上放置n个点,有多少对点之间距离恰好为1?近80年来,数学家认为最佳解决方案类似方形网格,这符合直觉认知。OpenAI的大模型推翻了这一信念,发现全新构造族,性能更优。这是人工智能首次自主解决数学领域核心著名未解问题,过程中还运用了代数数论这一数学分支工具。

剑桥大学和法兰西学院的Tim Gowers——菲尔兹奖得主——评论道:如果这篇论文由人类撰写并提交给《数学年刊》,我被要求给出快速意见时,会毫不犹豫建议接受。此前没有任何AI生成的证明达到这个水平。论文作者栏只写了一个公司名字:OpenAI。

为什么AI从业者如此热衷于挑战Erdős问题?原因多重。首先,Erdős问题集中在数论、组合学和图论,这些数学领域恰好是大型语言模型最擅长的。这些问题往往可用简洁语言描述,无需太多背景知识即可理解,但背后隐藏深刻结构。

其次,难度跨度很大。有些问题相对容易,有些极其困难。这正好适合能力参差不齐的新技术——水平不足时先选择较易问题,水平提升后再攻克难题。第三,Bloom的网站为所有人提供了现成入口。问题集中、状态清晰、还能讨论。对于需要基准测试的AI公司而言,这简直是天然测试场。

用Lichtman的话说:这种任何人都可访问的单一资源库——各实验室意识到,它完全可以作为基准测试。当AI比人类更强时,情况发生了变化。Noga Alon在职业生涯中解决过数十个Erdős问题,现在他不再从事这项工作。一旦AI开始解决它们,就没有意义了。

陶哲轩也退出了Erdős问题社区,专注于其他工作。van Doorn保持清醒认识,他说LLM在思考和做数学方面显然比我强,我根本比不上当前AI系统。但他也指出,我最终写的证明更简单、更通用,也比ChatGPT想出的东西更容易让其他人理解。

然后他说了一段意味深长的话:如果你想弹钢琴,不会雇一台弹得比你好钢琴演奏机器。你会弹钢琴是因为喜欢弹钢琴。我享受思考数字、做数学、写论文。我不会雇一台替我做论文的机器。2026年7月,多伦多大学Jacob Tsimerman被授予菲尔兹奖——数学界最高荣誉。就在同一天,他宣布离开学术界,加入OpenAI。

Alon表示,一些一流数学家离开学术界前往AI公司,不仅因为金钱,更因为这里或许才是真正发展方向。一个流浪一辈子的数学家,留下一堆标着价格的问题。几十年后,这些问题成为AI竞技场,将客服小哥和菲尔兹奖得主拉到同一评论区。Erdős如果还在,大概也会觉得这很有趣。

这场变革不仅仅是技术进步的体现,更是人类认知模式的根本转变。AI在数学领域的突破预示着未来科学研究的新范式,人机协作将成为主流趋势。传统的数学研究方法正在被重新定义,而Erdős留下的问题宝库,恰好成为了这一历史性转折的见证者和推动者。