数学家安德鲁·怀尔斯在1995年发表费马大定理证明时,那篇论文有129页。

为了验证这129页纸,顶尖人类大脑们熬了几个月。

AI配图

现在,Anthropic的Claude只花了11天。

11天,1300万行Lean代码,29500个中间定理。

老实讲,看到这个数据的时候,我第一反应是这模型是不是在胡乱凑字数。但帝国理工的数学大佬Kevin Buzzard看完后直接盖章:这是历史性的自动形式化成就。

书页边缘的装X笔记,坑了人类三个半世纪

先给不熟悉数学史的朋友补个课。

1637年,皮埃尔·德·费马在书页空白处写了个猜想,还极其嚣张地留了句话:我找到了一个绝妙的证明,但空白处太小写不下。

就这一句话,把后世数学家折磨了350多年。

1908年有人悬赏10万德国金马克,放今天大概一两百万美元,结果第一年就被薅了621个错误证明。

直到1993年怀尔斯站出来,讲了三天课,结果两个月后被人揪出致命漏洞。他又苦熬了一年才把坑填上。

人类证明数学定理,本质上是在拼逻辑链条。

只要断了一环,后面全废。人类写论文还喜欢跳步,那些显而易见的步骤直接就省了。

但计算机不吃这一套。

要想让Lean这种证明助手验证,你得把每一个极其微小的步骤都喂给它。帝国理工的团队今年刚启动费马大定理的形式化项目,光是初期蓝图就写了86页,大家估摸着这活儿得干好几年。

几十个AI智能体疯狂内卷,中途还翻过车

哥伦比亚大学的研究员Tianyi Peng想看看Claude能不能啃下这块硬骨头。

结果远超预期,不过过程并不是一帆风顺。

一开始,Claude的几个智能体很快就迷失了方向,协作彻底崩盘。

说实话,这太像我们平时在公司开小组会了,聊着聊着就不知道在干嘛。

这些翻车的废代码,大概占了最终证明里7%的非样板代码。

后来团队换了个思路,用上了开源协作平台Prove2Me。

这下场面控制住了。几十个Claude智能体开始疯狂协作,定义概念、证明中间定理、再拿去攻克更难的命题。

人类在这个过程中干了啥?

基本就是偶尔发几句高层指令,比如“雅可比作为概形听起来优先级很高”、“赶紧把Mazur定理推完”。

然后AI就自己闷头干。

当证明跑通的那一刻,Claude的内部日志里甚至能看出一种激动的情绪:

🏁🏁🏁FLT根节点在prove2me上显示PROVED。这是本次活动的最终目标。

烧掉30万美金,就为了当个超级验钞机?

有意思的是,这次AI并没有像之前搞黎曼猜想那样,弄出什么全新的数学发现。

它做的是验证。

把数学证明变成像计算器算数一样绝对可靠的验证。

有网友在评论区算了笔账:消耗了大约60亿输出token,按照API价格算,这一波大概烧掉了30万美金。

花30万美金验证一个人类早就证明过的定理,图啥?

个人觉得,Kevin Buzzard说到了点子上。

现在AI生成的数学证明越来越多,人类审稿人根本看不过来。让AI去形式化验证AI生成的数学,这可能是数学界唯一能跟上AI产出速度的办法。

这其实是在给AI自己擦屁股。

而且这技术还在下沉。Anthropic拿三个普通的Claude Max个人订阅账号,只花了3天就把Vinogradov的三素数定理给形式化了。

这意味着以后普通研究员买个订阅,也能搞这种大型验证。

数学家的饭碗保住了,但工作方式得变

很多人担心AI会抢了纯数学家的饭碗。

老实讲,机器验证永远替代不了人类能看懂的数学推导。

你让一个数学家去读1300万行Lean代码,他大概率会当场辞职。

但未来的数学论文,大概率会标配一份形式化代码。

就像现在写代码必须带单元测试一样,以后搞数学研究,不带个机器验证过的证明,你可能都不好意思投顶会。

费马大定理的证明,凝聚了三百年来无数天才的心血。从Frey到Serre,从Ribet到Mazur。现在AI用11天时间,把这些人类智慧结晶翻译成了一种机器能绝对信任的语言。

当机器开始接管验证这种苦力活,人类数学家是不是终于可以把精力全放在提出好问题上了?

又或者,当AI连验证都能做得这么完美时,它离自己提出那个绝妙的证明,还剩多远?

【锐评】:花30万刀让AI把350年前的装X笔记翻译成1300万行代码,人类数学家以后发论文怕是得先过一遍机器查重了。

参考链接:
https://www.anthropic.com/research/formalizing-fermats-last-theorem