AI形式化验证费马大定理:1300万行代码背后的数学协作革命
费马大定理——这个困扰数学界三百余年的难题,在1995年已被安德鲁·怀尔斯彻底解决。然而,2025年,它再次成为焦点。这一次,并非因为新的数学突破,而是因为人工智能首次完成了对其完整证明的端到端形式化验证。Anthropic团队披露,其大模型Claude在短短11天内,生成了约1300万行Lean代码,成功将怀尔斯的证明转化为计算机可逐行检查的严格逻辑链条。这一工程不仅刷新了AI处理复杂数学任务的能力上限,更预示着数学研究范式的潜在变革。

形式化验证:为何要“重证”一个已知正确的定理?

表面上看,对一个已有公认证明的定理进行形式化似乎多余。但数学界的共识建立在人类审阅之上,而人类审阅存在天然局限。怀尔斯原始证明长达129页,横跨代数几何、模形式、伽罗瓦表示等多个高深领域。审稿人需追溯每一步所依赖的前置定理,确认其适用条件是否满足,逻辑推导是否严密。这一过程耗时近两年,且仍可能遗漏细微错误——事实上,最初的版本确实存在关键漏洞。

形式化证明则试图消除这种不确定性。它要求将自然语言中的每一个推理步骤,都转化为基于明确公理系统的、无歧义的符号操作。Lean等证明助手如同一位永不疲倦、永不犯错的审稿人,只认逻辑规则,不依赖直觉或权威。只要输入符合语法,它就能机械地验证从前提到结论的每一步是否合法。这种验证方式虽繁琐,却提供了前所未有的确定性。

过去二十年,形式化社区(如Lean的Mathlib项目)已成功验证了大量经典结果,包括素数定理、哥德尔不完备定理等。但像费马大定理这样体量庞大、结构复杂的现代证明,一直被视为“珠穆朗玛峰”。专家普遍估计,完成其形式化需要一个大型团队数年努力。Anthropic的成果之所以震撼,正在于它将这一时间尺度压缩到了11天。
1300万行代码:AI如何重构数学证明的生产流程?
Claude并未发明新数学,而是扮演了“超级形式化工程师”的角色。它基于Henri Darmon等人整理的怀尔斯证明简化路线,系统性地将其中涉及的定义、引理、定理逐一编码为Lean可理解的形式。整个过程产出30300个中间定理的机器验证版本,最终汇集成费马大定理的完整证明树。
值得注意的是,人类干预极为有限。研究员Tianyi Peng仅提供高层指导,如“优先处理雅可比簇的概形定义”或“加速Mazur定理的形式化”。具体的技术实现——包括如何分解问题、选择证明策略、调用已有库函数——均由Claude自主决策。这体现了当前AI在结构化推理和知识整合上的惊人能力:它能理解跨领域的数学概念,并在庞大的依赖网络中找到可行的推进路径。
然而,1300万行的代码量也暴露了当前方法的粗糙性。作为对比,整个Mathlib核心库仅约250万行。Claude的输出包含大量重复、冗余甚至迂回的证明步骤,远未达到人类专家编写的简洁优雅。这说明AI目前擅长“ brute-force verification”(暴力验证),而非“elegant proof construction”(优雅构造)。但正如早期编译器生成的汇编代码同样冗长,效率问题可通过后续优化逐步解决。首要突破在于证明了可行性——如此复杂的现代数学证明,确实可以被完全形式化。
Prove2Me:多智能体协作的“操作系统”
单个AI模型难以驾驭如此宏大的任务。Anthropic的成功关键,在于其开发的协作平台Prove2Me。该平台将整个证明工程建模为一张有向无环图(DAG):每个节点是一个待证命题,边表示逻辑依赖关系。这种结构天然支持并行化——只要一个节点的所有前驱节点被证明,它就可被独立处理。
Prove2Me为多个Claude智能体提供了共享的“工作记忆”。智能体可查询全局依赖图,了解哪些子目标已完成、哪些仍悬而未决;它们还能检索其他智能体已提交的证明片段,避免重复劳动。平台还将定理陈述与证明代码分离存储,大幅缩短Lean的增量编译时间,使数千次试错迭代在计算上可行。
早期实验曾因缺乏协调机制而失败:智能体各自为战,很快陷入混乱。Prove2Me的引入,相当于为AI团队配备了项目管理工具和版本控制系统。这印证了一个深刻洞见:在复杂知识工程中,协作架构的重要性不亚于单体智能水平。未来,类似平台可能成为AI驱动科研的基础设施,不仅用于数学,还可扩展至形式化验证软件、硬件乃至法律条文。
验证的验证:AI证明的可信度边界
一个自然的问题随之而来:如果证明由AI生成,我们如何相信AI没有犯错?答案在于形式化验证的分层信任模型。Lean的核心验证器(kernel)仅有数百行代码,经过严格审计,其正确性可被人类完全掌握。只要证明脚本通过该验证器,即可断言其逻辑无误——无论脚本由人还是AI编写。
Anthropic团队进一步使用独立工具比对了Claude生成的费马大定理陈述与Mathlib中的标准版本,确认二者在数学上等价。这意味着,AI不仅正确实现了证明,还准确理解了目标定理的内涵。
当然,机器验证无法替代人类理解。Lean能告诉你“证明正确”,但不会解释“为何如此巧妙”或“这一思想如何启发新方向”。未来的数学论文或许会包含两个部分:面向人类的叙事性证明(强调动机、类比与洞察),以及面向机器的形式化附件(确保绝对严谨)。这种分工将释放人类研究者的创造力,同时筑牢知识大厦的根基。
从实验室到社区:形式化验证的民主化潜力
Anthropic还展示了一项更具普惠意义的实验:仅用三个普通Claude Max账号,在Prove2Me平台上三天内完成了维诺格拉多夫三素数定理的形式化。这表明,一旦协作框架成熟,大规模形式化不再专属顶尖AI实验室。小型研究团队甚至个人学者,都可借助此类工具验证自己的工作,或参与社区共建项目。
Kevin Buzzard等数学家长期倡导“数学的数字化转型”。他们认为,形式化库不仅是验证工具,更是结构化的数学知识图谱,能促进跨领域发现与教学。AI的加入,将极大加速这一进程。想象未来,研究生在学习模形式理论时,不仅能阅读教材,还能交互式探索其在Lean中的完整形式化实现,即时验证自己的理解。
结语:迈向人机共生的数学新生态
Claude对费马大定理的形式化,不是终点,而是新起点。它证明了AI能在人类设定的框架下,高效执行超大规模的严谨推理任务。尽管当前输出尚显笨拙,但其核心价值在于将验证从人力密集型活动转变为可扩展的计算过程。
随着模型能力提升与协作工具进化,AI有望承担更多形式化工作,甚至辅助发现新证明。但数学的灵魂——提出深刻问题、构建优美理论、洞察隐藏联系——仍将属于人类。未来的数学研究,或将呈现一种共生关系:人类负责“想”,AI负责“验”;人类探索未知,AI守护已知。在这场人机协奏曲中,费马大定理的形式化验证,无疑奏响了第一个清晰的强音。