陶哲轩警告AI将把数学拖入类似1900年的基础危机——此次受考验的不是数学真理,而是学科价值观:什么算贡献、谁该获奖励;其经验法则:无人能解释的证明应视为不完整。
数学家陶哲轩在一篇新论文中指出,AI 可能将数学拖入一场堪比二十世纪初基础危机的动荡。
数学界不应该继续争论 AI 能做什么,而应该面对一个他们基本回避的问题:数学研究的真正目标究竟是什么?从不同角度看,数学要么正在进入黄金时代,要么正在陷入深度危机。陶哲轩在 2026 年国际数学家大会上发表的论文中写道。
陶哲轩将这场危机与 1900 年至 1930 年间动摇数学基础的那场危机进行了类比,当时罗素悖论和哥德尔不完备性定理迫使数学家们明确说出他们一直默认的假设。那场危机催生了一套严密的框架,沿用至今。
陶哲轩认为,如今的压力测试已经转移了。它不再关于数学真理,而是关于"一套 largely implicit 的数学价值观和实践框架":什么样的贡献算贡献?什么会得到奖励?理解某件事意味着什么?机器能否被认为完成了这项工作。
他的工作假设是:"AI 工具将在合理的时间内,变得能够以合理的成功率、质量、监督水平和成本,完成合理比例的研究级数学任务。"
作为证据,他提到了 First-Proof Project。在第二轮中,十个从未发表的研究问题在受控条件下对四个 AI 系统进行了测试。其中十个问题中有七个获得了至少一个系统至少一次的通过评分,即解决方案被判定为基本无缺陷或只需小幅修改,每个问题的成本在几十到几百美元之间。
当指标成为目标
陶哲轩写道,数学的诸多目标始终紧密相连——解决问题、建立理论、促进社区、培养下一代,这些环节相互促进。AI 威胁要将它们分离。
他引用了古德哈特定律:"当一个衡量指标变成目标时,它就不再是一个好的衡量指标。"生成式 AI 尤其容易出现这种情况,因为它追逐的是良好输出的表象,而非实质。AI 行业的经济激励通过奖励正是数学家长期以来用作深层目标替代品的那些可引用、可量化的成果,使情况变得更糟。
证明过多,理解不足
如果工作假设成立,陶哲轩警告,该领域可能从证明稀缺转向证明过剩,AI 生成的证明堆积如山,速度超过任何人检查、阅读或吸收的速度。Erdős 问题数据库已经收录了数十个 AI 生成的提交,但没有人类专家自愿去验证。
AI 打磨过的证明有另一个问题。陶哲轩观察到,在人类撰写的证明中,困难的部分往往保留着自然的摩擦:一个谨慎的引理、一个符号的变更,以及一个明显经过多次重写的段落。过 度打磨的 AI 证明既去除了杂乱,也去除了那些有用的信号,产生的文本"易于阅读却难以学习"。正如陶哲轩所说,人类阐述中的"错误""对读者确实有帮助"。
没有人能解释的证明是不完整的
对于具体指导,陶哲轩指向了 2026 年 6 月发布的《莱顿人工智能与数学宣言》,该宣言得到了国际数学联盟的支持。
他自己的经验法则:"如果作者不能令人信服地证明他们能够对结果进行清晰、专家级的演讲——正确且归属得当——那么该结果不应发表。"没有人能够 proper 解释的证明应被视为不完整,即使它已经过形式验证。
陶哲轩认为,培养年轻数学家需要特别小心,因为数学家需要保护其工作中"不可还原的人类层面",并严格限制 AI 工具的使用。培养数学家的目标不是通过产出正确的作业来实现的。陶哲轩本人披露,他使用 AI 进行文献检索、图表创建、文本补全,以及将幻灯片转换为论文格式。
最近,著名数学家 Timothy Gowers 和 Peter Sarnak 承认大语言模型具有真正的数学能力,但在真正的新想法方面存在局限,这一发现也出现在其他研究中。陶哲轩的论文超越了那场争论,因为他不太关心 AI 能做什么或不能做什么,而更关心数学本身真正想要什么。
无炒作的 AI 新闻——人工精选
订阅 THE DECODER,享受无广告阅读、每周 AI 时事通讯、我们独家的"AI Radar"前沿报告(每年六期)、完整档案访问权限,以及评论 section 访问权限。
继续阅读以获取完整画面。订阅无炒作报道。
THE DECODER 每篇文章的完全访问权限
加入评论和社区讨论
每周 AI 新闻摘要邮件
每年六期:"AI Radar"——深入探讨最重要的 AI 话题
每日 AI 新闻,始终保持最新
我们完整的十年档案
由拥有 10 年以上 AI 经验的团队报道