2025年8月,Sebastien Bubeck发了一篇帖子,浏览量迅速突破700万。原因很直接:GPT-5 Pro用17分5秒,独立证明了一个凸优化领域的新下界,将已知边界从1/L推进至1.5/L。这个数字在工程界或许平常,但在数学圈子,无异于一场地震。随后,2026年初,AI在埃尔德什问题等数十年未解难题上的进展加速。到2026年5月,GPT-5.5 Pro甚至能在不到2小时内完成一项博士级数论研究,并输出一篇完整的LaTeX论文,其中撰写LaTeX代码仅耗时2分23秒。
面对这一连串事件,舆论场上充满了“AI博士”的欢呼,或者“数学家失业”的恐慌。但把时间拨到2026年9月,冷静回看这十几个月,会发现喧嚣掩盖了更值得关注的技术现实。AI并没有获得某种神秘的“数学直觉”,它只是把人类几十年积累的数学工具库,变成了一台超高通量的暴力计算引擎。
我们需要先拆解那个著名的“17分钟证明”。GPT-5 Pro在凸优化梯度下降步长下界问题上的表现,本质上是一场完美的“闭卷考试”。这道题定义清晰,工具明确,属于典型的组合优化型问题。AI的优势在于它能瞬间访问整个数学工具库,并进行近乎无限的暴力穷举。它找到的,是一个被人类学者忽略的、已知的“组件变体”,并将其成功应用。
这就好比一个阅读量无限大、手速极快的实习生,在图书馆里瞬间翻遍了所有相关章节,然后指出了一个前辈可能忽略的拼图块。这厉害吗?当然厉害。如果我是同行,看到它能在我喝咖啡的时间内完成我可能需要花几周才能验证的推导,我会感到极大的效率压力。但这绝不意味着它具备了数学家的“洞察力”或“品味”。
真正揭示AI能力边界的,不是它做对了什么,而是它在做对之后,人类依然能做得更好。GPT-5 Pro刚把下界推到1.5/L,人类学者很快又将其推至1.75/L。在埃尔德什问题上,AI的证明在被验证后,人类又发现了一个更简单、更优雅的解法。这说明当前AI的数学能力实质,是一个无比强大的“搜索引擎”兼“组合优化器”。它能高效发掘已知工具的新组合,就像一台超高效的粒子对撞机,通过海量尝试撞出新的现象。但数学研究的灵魂,往往在于提出那个正确的问题,或者为已有的现象构建一个全新的、优美的解释框架。目前的AI,在这类概念创新层面,连影子都没有。
陶哲轩提到的“报告偏差”是关键。我们在社交媒体和新闻里看到的,是那1%到2%的成功案例——那些被开源项目系统记录下来的、AI攻克的经典难题。但这些成功样本背后,是成千上万次失败的尝试。AI在未解难题上的真实成功率极低,约1%-2%。这就产生了一种严重的认知偏差:我们以为AI是“解题高手”,实际上它是个“碰运气专家”。
验证瓶颈与质量危机
比“能不能做出来”更紧迫的问题,是“做出来的东西对不对”。这就是为什么BrokenArXiv基准测试的数据让人皱眉。该测试评估模型识别有缺陷数学问题的能力,结果最先进的模型(如GPT-5.4)成功率不到40%。
这意味着什么?意味着AI目前的数学产出,必须依赖人类专家进行严格的验证与筛选。它依然是个严重的“偏科生”。在菲尔兹奖得主们的眼中,他们目前的角色不是被取代的旧神,而是不可或缺的质量控制官和意义阐释者。如果AI只能生成海量且包含错误的证明草稿,而人类专家没有足够的时间和资源去“校对”这些草稿,那么这种效率提升就是伪命题。
Timothy Gowers对此的预言非常直白:“我们将很快面临一场危机。”这场危机的核心,不在于AI能解出多少道题,而在于它可能改变下一代研究者对“研究”本身的定义。如果AI可以高效执行路径探索,那么人类研究者的价值是否只剩下最后的“把关”?
更深层的冲击在于教育体系。博士培养的核心,历来是学会提出问题、设计路径、忍受漫长挫败,并最终建立一套自洽的理解。AI目前展现的,只是路径执行和知识检索环节的惊人效率。如果年轻学生习惯了对接AI工具,让他们去“搜索”答案,而不是去“发现”问题,那么他们将在最关键的概念构建训练上缺失。未来的数学家,其核心竞争力将不再是如何快速推导一个公式,而是如何判断AI给出的哪个推导是优美的、哪个是平庸的、哪个是彻底错误的。这种“品味”和“批判性思维”,是目前无法被模型参数化的能力。
范式转移的实质
回顾2025到2026年初这段时间,基础科学研究范式确实正在向“人机深度协作”转变,但这个转变被过度简化了。研究者需要的,不是把AI当作高级计算器,而是掌握驾驭AI工具进行初步探索的能力。核心精力必须转向成果的批判性验证、整合与理论升华。
对于像黎曼猜想这样的顶级难题,目前的AI希望渺茫。这类问题通常需要前所未有的概念突破,跨越多个领域的深刻洞察,而不仅仅是现有工具的重新组合。AI目前的成功案例,集中在工具路径相对清晰的领域,比如凸优化、某些组合数学问题。对于需要定义全新“游戏规则”的难题,现有范式几乎无能为力。试图用暴力穷举去撞开黎曼猜想的大门,在方法论上就是错的。
因此,争论“AI是否具备博士级能力”本身是个伪命题。AI在特定类型(工具组合型)问题上展现出超强的探索效率,可产出“博士级”的证明结果,但它缺乏提出核心概念、判断研究品味及长时间规划的能力。它更像一个能力超凡的“研究助理”,而非独立研究者。
对于行业而言,真正的挑战不在于技术本身,而在于评估机制。我们必须建立严格的基准与负面结果披露机制,警惕“幸存者偏差”。如果公开的数据只展示那1%-2%的成功,而隐藏了98%的失败,那么整个学术界对AI能力的信任基础就是脆弱的。只有当AI不仅能“做”,还能可靠地“验”,甚至能解释“为什么”的时候,它才能真正从工具升级为合作伙伴。
在2026年的当下,数学界的格局正在重塑。人类数学家并未消失,但他们的职责发生了根本转移:从计算者转变为提问者与验证者。AI的突破核心在于高效组合已知工具,而非概念层面的原创性创新。认清这一点,比恐慌“AI是否会取代人类”重要得多。我们不需要害怕一个会做题的机器,我们需要警惕的是,人类是否还会保留做问题的能力。