41道题,16道题,2道题。
这不是选择题选项,而是一场为期14天、针对全球顶尖大语言模型的数学“绞杀战”的战果。49位人类数学家联手出题,从100道“研究级”难题开始,试图为AI设下最后一道理科壁垒。
结果,壁垒几乎被夷为平地。


一场精心设计的“学术突击测验”

故事发生地是德国莱比锡的马克斯·普朗克研究所。2026年春天,一群数学家关起门来,干了一件“得罪人”的事:他们编纂了100道题目,声称这些题目是真正的“研究级”,不是教科书习题,而是博士生在特定领域钻研数天甚至数周才可能解决的问题。

他们的目标很明确:测试AI。
测试分三轮。第一轮,五个当时的顶级大模型各自尝试一次,41道题无人能解。第二轮,选出三个模型,每个对每道题跑20次,结果剩下16道无人攻克。最后一轮,上“重量级”思考模型,最终,仅剩2道题,守住了人类智慧的最后一道防线。

莱比锡基准测试结果示意图,显示题目数量从100逐步减少到2
(假设性描述图注:莱比锡基准测试结果,显示题目数量从100逐步减少到2)

研究团队负责人亲自下场补充:“这些问题远比任何考试题都难。想象一下,一个专门研究该领域的博士生,也需要数天到数周来理解并解决它。”

关键点:这不是奥赛题,是“学术自习题”

这里有个极其微妙的区别,也是这场测试最让人五味杂陈的地方。
评论区一针见血地指出:这些问题都有已知答案,且答案可从已有文献中推断出来。 这不是让AI去攻克一个无人知晓的数学猜想,而是考验它能否在浩如烟海的学术论文和训练数据中,精准地拼凑出答案。

打个比方,这更像是给一个超级博学但从未亲自动手验证的学者做开卷考试,考的都是“参考文献里写着”的答案。
所以,它测的是“检索与组合推理能力”,而非“原创突破能力”。 尽管如此,从41到2的跨越,依然展现了恐怖的模式识别与逻辑串联水平。

“正确率”背后的暗礁:你敢信它的答案吗?

当所有人都在为“只剩下2道题不会”而惊叹时,另一组数据更值得细品。
有细心的网友分析了具体模型的表现。以GPT 5.5和Opus 4.7为例,在20轮测试中:

  • GPT 5.5回答了1389次,其中1043次正确。
  • Opus 4.7的回答模式则有所不同。

这引出了更实际的问题:作为工具,我们不仅要看它能解多少,更要看它“误判”了多少。 一个答案错误率高的AI,在科研或工程中可能比完全不会的AI更危险。个人觉得,这才是未来AI数学工具落地时,工程师们最夜不能寐的指标。

“银河系漫游指南”照进现实

最有趣的评论来自一位网友:“这让我想起了《银河系漫游指南》,我甚至期待某些题的答案是42!”
这句调侃,精准地击中了某种时代情绪:当机器开始用超越常人的方式处理抽象的数学问题时,过程与结果都带上了超现实的荒诞感。我们是否正在见证一个“新柏林”(评论中的梗)式的智力中心转移?

悬念:数据泄露的“房间里的大象”

就在大家为AI的数学能力欢呼时,一条不起眼的评论链接指向了一篇2023年的论文,标题是“希望他们给数据集加密了”。
这才是整个故事里最值得警惕的“反转”。 如果用于测试的问题,或者相似的问题,早已存在于模型的训练数据中,那么所谓的“解决”就更像是一次“默写”而非“解题”。这场基准测试的公信力,就建立在数据完全“未知于模型”这个脆弱的假设上。

结语:机器的“懂”与人类的“忧”

两周时间,100道人类智慧的结晶题,被AI攻陷了98%。这无疑宣告,AI的数学推理已进入“准专家”领域。
但当我们剥离掉“解题正确率”这个光环,看到背后可能的数据污染、错误率风险,以及“开卷考试”的本质时,一个问题浮出水面:
当机器解题的速度和正确率开始碾压人类,我们焦虑的,究竟是能力的落后,还是对“理解”与“创造”定义权的丧失?

【锐评】用已知答案的题库打败AI,就像用去年的高考试卷证明学神地位——结果震撼,但药不对症。真正的数学前沿,还在黑暗中等待那束全新的光。

参考链接:
https://arxiv.org/abs/2606.05818