AI数学竞赛白热化:OpenAI与Anthropic的24小时攻防战

1 阅读

引言:AI巨头在数学前沿的短兵相接

2026年8月的第一个周末,人工智能领域迎来了一场前所未有的数学竞赛。OpenAI与Anthropic两大AI巨头,在数学的最前沿展开了一场惊心动魄的攻防战。先是OpenAI研究员Sébastien Bubeck宣布,其未公开的下一代主力模型Astra,一口气证明了10项前沿数学成果,并提供了完整的Lean证书和逐题思路复盘。这些成果并非简单的习题,而是多年未解的开放难题,其中一些甚至沉寂了数十年。然而,仅仅24小时后,Anthropic的研究员Levent Alpöge便宣称,其公开模型Fable已成功复现了其中5项。这一事件不仅震惊了数学界和AI界,更引发了关于AI能力、成果验证以及人类在科研中角色的深刻思考。

OpenAI研究员Sebastien Bubeck发布的推文

事件回顾:10项难题与24小时反转

一张包含英文及中文翻译的社交媒体截图,内容关于OpenAI

OpenAI的震撼发布

一条关于Anthropic员工使用Fable复现OpenAI

8月1日,OpenAI研究员Sébastien Bubeck在社交媒体上宣布,其未公开的模型Astra成功证明了10项前沿数学成果。这些成果涵盖了多个数学分支,包括群论、数论、几何等,其中一些结论至少10年无人推进,甚至有些是几十年的悬案。Bubeck还附上了10份Lean证书(一种形式化验证工具)和逐题思路复盘,展示了AI在数学推理上的强大能力。Epoch AI旗下FrontierMath的负责人Elliot Glazer评价道,仅其中关于非索菲克群的研究,就足以发表在数学界顶级期刊《数学年刊》(Annals of Mathematics)上。

一张社交媒体截图,内容涉及AI模型(Astra)在数学证明(

Anthropic的快速反击

Dr Singularity 关于 OpenAI 数学突破及

然而,OpenAI的“首发”并未持续太久。不到24小时,Anthropic研究员Levent Alpöge在Bubeck的帖子下回复:“我用Fable完成了一半。”他补充说,自己复现了OpenAI榜单上的第4、5、6、7、8项,共5项。实验条件被描述为“完全自主、通用提示词、全程无网络”,并特意加了防护措施,防止OpenAI的解法泄漏到上下文中。尽管Levent尚未放出完整的证明细节,但这一声明已足以引发轩然大波。

意义深远:从“首发”到“复现”的转变

首发优势的保质期缩短

过去,数学成果的优先权之争通常以年为单位。从提出猜想、证明、投稿、审稿到发表,往往需要数年时间。然而,Astra的成果在24小时内就被Fable复现了一半,这意味着AI时代下,数学发现的“首发”优势保质期急剧缩短。网友Chubby调侃道:“公开可用的Fable,复现了Astra一半成果。这么看,OpenAI是不是只抢到了一个首发?”这一现象不仅改变了数学研究的节奏,也对科研评价体系提出了挑战。

从“刷榜”到“验货”的范式转变

Fable复现Astra的成果,并非简单的“刷榜”行为。刷榜通常是在已知答案的情况下测试模型性能,而这次是两个模型在无网络、防泄漏的条件下,独立抵达同一前沿结论。这更像是一场“同行评审”,检验的是结果的可靠性和可复现性。这种“互相验货”的模式,可能成为未来AI科研的重要范式。

成本分析:2000美元背后的真实代价

OpenAI还透露,找到这10项解法的成本不到2000美元。这一数字是根据成功运行所需的token数,按Sol API价格折算得出的。然而,这仅仅是边际推理成本,并未包括Astra模型的训练研发费用、失败尝试的投入、人类整理论证的工时、形式化证明的成本以及外部数学家审查的费用。Noam Brown也承认,他们尝试过其他重大问题但未成功,千禧年大奖难题一个都没拿下。尽管如此,2000美元的成本依然将AI解出一道前沿难题的边际成本降到了极低水平,引发了关于AI科研经济性的广泛讨论。

一张社交媒体推文截图,内容涉及PDF文件上传限制、CDN网站

验证危机:当AI证明速度超越人类理解

Noam Brown发布的关于Sol API生成证明成本及A

公众的认知鸿沟

这10项成果的重要性,对绝大多数人来说难以判断。Ethan Mollick指出:“对地球上几乎每一个人来说,这不只是超出能力,而是超出理解范围。我们只能相信专业数学家告诉我们它厉不厉害。”与代码、图片、聊天等可直观体验的AI能力不同,非索菲克群的存在、Connes刚性猜想的反例、量子平行重复定理等,只有极少数专家能看懂。AI能力越往科学前沿走,公众能依靠的就越不是亲身体验,而是一条长长的信任链。这种“连惊叹都无从惊叹”的状态,正在越来越多领域发生。

包含10条数学与计算机科学领域学术成果摘要的列表图片,涉及高

数学家的视角

Ethan Mollick关于AI能力超出人类理解范围的推文

数学家Thomas Bloom提醒,这些成果利用了上百年积累的数学理论和形式化系统,将其简单描述为“AI取代了数学家”并不诚实。他提出的标准是:这份证明有没有教给我们关于这个问题的新东西?因此,真正的问题在于:当AI能低成本、批量地生产前沿数学证明,我们该如何衡量其成果的价值?答案或许不在产出端,而在验收端:一份证明能否被读懂、被核对、被判断出分量,决定了它的真实价值。最稀缺的能力正在从“做出证明”转向“看懂并验收证明”。

未来展望:AI与数学研究的融合

验证能力的挑战

当AI一夜之间就能证出十道难题,真正的考验才刚刚开始。证明越造越快,我们的验证能力是否跟得上?这不仅是技术问题,更是制度和文化问题。数学界需要建立新的验证机制,例如利用AI辅助验证AI的证明,或者培养更多具备形式化验证能力的数学家。

人机协作的新模式

尽管AI展现了惊人的推理能力,但人类数学家的角色并未消失,而是发生了转变。他们从“证明者”变为“验证者”和“解释者”,负责将AI的成果转化为人类可理解的知识。这种协作模式可能成为未来科研的主流。

结论:AI时代的数学新生态

这场24小时的攻防战,不仅展示了AI在数学推理上的巨大潜力,更揭示了AI时代科研范式的深刻变革。从“首发”到“复现”,从“证明”到“验证”,AI正在重塑数学研究的每一个环节。然而,无论AI多么强大,人类的理解和判断始终是科学进步的基石。当AI能批量生产证明时,我们更需要培养能够“看懂”和“验收”这些证明的专家,以确保知识的可靠性和传承。这场竞赛的最终赢家,或许不是某个AI模型,而是能够驾驭AI、推动人类知识边界的人类智慧。