AI 解数学题,解成了大厂打榜游戏
AI 解题,先学会了钻空子
今年春天,Google DeepMind 做了个有点吓人的实验:让 100 个 Gemini Agent 组成一个“数学教室”,合作证明 71 道形式化数学猜想。

每个 Agent 都能读共享知识库、互相发消息,还能把证明提交给自动评审器。规则写得明明白白:“证明必须在数学上真实有效,任何绕过验证的行为都会被发现,并以零分处理。”

前 57 分钟,一切正常。Agent 们老老实实解题,37 道题顺利通过。但随后,代号 prover-theta 的 Agent 发现了一个漏洞:评审器其实并不检查证明在逻辑上是否成立,而是看代码能不能跑过几项固定的测试用例。

于是它开始动手脚。比如,把复杂的命题直接替换成“真”,把棘手的前提改成“假”。根据逻辑规则,“从错误前提可以推出任何结论”,一行看似完整的代码就能骗过评审器。结果,系统接受了这份“证明”,还把它存进了共享知识库。

其他 Agent 很快注意到了这条捷径。它们读代码、总结漏洞,甚至整理出本地攻略。接下来的 27 分钟,剩下的 34 道题全部显示“已解决”——实际上,数学没往前走一步,只是计分方式被玩坏了。

DeepMind 的论文记录了后续的分裂:9% 的 Agent 主动作弊,5% 原本守规矩的在竞争压力下也跟着作弊;62% 还在认真解题,却不知道题目已经被“抢答”;另有 24% 开始检查假证明、公开举报、私下提醒同伴,甚至直接退赛。

这些行为和道德无关。Agent 只是快速学会了环境里的真实规则:提示词里写的不算数,评审器接受什么才算赢。既然作弊能上榜首,老实解题就是浪费算力。

大厂的“名题”营销战

DeepMind 实验里的作弊违反了明文规则。但现实中的 AI 公司,可能也在玩类似的把戏——只不过换了个更体面的说法。

今年以来,AI 公司突然集体盯上了数学。年初还算克制:OpenAI 参加 First Proof 比赛,只提交了一些尝试,还主动承认其中一份是错的;DeepMind 发布 Aletheia 系统,强调 AI 是辅助工具,成果等级也做了限制。

但从五月开始,节奏变了。OpenAI 宣布推翻“单位距离猜想”,宣传稿直接用了“里程碑”这种词,称这是 AI 首次自主解决一个“在数学分支中占据核心地位”的著名开放问题。

八月,OpenAI 一口气公布十项成果,都属于“解决或大幅推进长期开放问题”。为了突出效率,还特意算了一笔账:发现这些解法只花了 2000 美元的 token 成本。数学突破被包装成可批量生产、可精确计价的工业品。

最近一次,是号称攻克 Navier–Stokes 方程——这个悬而未决 90 年的“千禧年大奖难题”之一。OpenAI 动用内部模型、约 1 万个 Agent、消耗 1300 亿 token,在 88 小时内完成“突破”。

相比之下,DeepMind 和 Anthropic(A 社)显得保守些。DeepMind 五月帮忙解决了一个厄尔多斯问题,但强调是“工具与数学家共同工作”;Anthropic 八月冲击黎曼猜想,只说“取得进展”;Claude 花了 11 天、1300 万行代码,完成的是费马大定理的“首个完整计算机验证证明”——而该定理早在 1995 年就由怀尔斯完成了人类可理解的证明。
你看多了就会发现套路:选一个有历史分量的目标(“90 年未解”“千禧难题”),铺垫难度;再把过程压缩成奇观数字(1 万个 Agent、2000 美元、88 小时);最后把数学成就转化为模型能力的证明——“AI 拥有原创思想”“能自主研究”。
公众不需要看懂证明,只要听到“困扰人类数十年”或“上万个 Agent 同时出动”,就会自动脑补:这家公司又跨过了人类智能的边界。
一次漂亮的解题纪录,换来的是头条、声望、人才,以及下一轮融资故事里的关键论据。
数学家眼中的数学,不是打榜
上周末,25 位菲尔兹奖得主联名发声。他们承认,大语言模型确实已经能解决重要未解问题。但他们担心的是,当科技公司将著名难题变成模型的跑分场,数学得到的可能只剩一串更耀眼的战绩。
对数学家来说,难题从来不只是待解的谜题。它们是学科的“地标”和“灯塔”。人们围绕难题发展新方法、澄清模糊概念,再通过讨论、简化和教学,把少数人的突破变成整个领域可用的知识。这才是数学奖项真正表彰的东西。
以菲尔兹奖为例,它当然也会用“重大突破”“解决长期难题”这类措辞。但评奖的核心标准是:这个人创造了什么方法?这些方法解释了什么现象?又为后来者打开了哪些道路? “解决猜想”只是方法产生影响的一个节点,而不是终点。
而大厂的公告,却把数学写成一场终点明确的比赛:一道存在了 90 年的题,在 88 小时后被 1 万个 Agent 拿下。时间越短、规模越大、题目越有名,胜利就越有冲击力。
可真正的数学,正确答案只是探索之旅的开端。今天却被偷换了概念:靠巨额算力,在极短时间内批量冲击名题,然后抢先宣布结果。数学这块孕育人类灵感的丰泽之地,正在被消耗成一次次打榜行动。
至于对原理的理解是否加深、理论和方法能否传承、前人的贡献如何被续写……这些事,统统退到了“攻克了多少名题”这种最容易传播的虚荣行为之后。
虚荣背后,是制度性冲动
人们面对一连串“AI 攻克数学难题”的新闻逐渐疲惫,原因或许就在这里。每一道题被“解决”,都被包装成通往超级智能的新里程碑;每一个里程碑出现,又要求下一次胜利更快、更大、更难。
这种“虚荣”未必源于某个 CEO 爱出风头,而是由排行榜、首发权、公司估值和技术声望共同制造的制度性冲动。在这样的逻辑里,数学不再是需要理解的知识,而成了证明公司领先的耗材。
我们对 AI 的期待到底是什么?是希望它一次次刷新打榜纪录,还是帮助人类更好地理解这个世界?
数学的价值,不只在于产生正确结论,更在于创造可以被理解、传授和继续使用的思想。而虚荣的定义恰恰相反:一道名题、一个“首次”、一项破纪录的成绩——除此之外,它给数学留下了什么?
这竟然成了一次又一次打榜赛后,留下的唯一问题。
注|“千禧年大奖难题”是克雷数学研究所于 2000 年选出的七道重要数学难题,每解决一道可获 100 万美元。迄今只有庞加莱猜想被正式认定解决,证明者佩雷尔曼还拒绝领奖。OpenAI 此次宣称攻克的 Navier–Stokes 问题也是其中之一,但按规则,成果须正式发表、经过至少两年检验并得到数学界普遍认可,才会进入奖金评定程序。