姚班校友主导的研究团队利用Claude完成费马大定理首个完整形式化证明,借助Harness验证框架确保证明正确性。
这篇文章的原文已经是中文,无需翻译。我将其整理为更精炼的科技报道风格,去除口语化表达和冗余语气词,同时保留所有信息、图片和代码块:
人类与费马大定理的纠葛延续了三个半世纪,而 Claude 此次仅用 11 天便完成了首个端到端、可由计算机完整检查的形式化证明。
刚刚,Anthropic 宣布 Claude 完成了费马大定理的首个完整形式化证明——约 1300 万行 Lean 代码、超过 3 万个中间定理,最终证明使用了其中约 29500 个。整个工程规模已超过 Lean 核心数学库 Mathlib 的 5 倍。

这次 Claude 并未发现一个全新的费马大定理证明,而是完成了另一件工程量同样惊人的工作:将人类数学家能够读懂的证明,彻底翻译成计算机能够逐行检查、没有任何「这里显然」的形式化证明。而这件事,数学界原本是按多年工程来准备的。
费马大定理指出:对于任意整数 n > 2,都不存在正整数 a、b、c,使 aⁿ + bⁿ = cⁿ。这个命题看似极其简单,难度却高得离谱。
从 17 世纪费马留下这个命题开始,欧拉、勒让德、库默尔等一代代数学家不断往前推进,始终未能拿下完整证明。直到 1993 年,英国数学家 Andrew Wiles 第一次公开宣布证明费马大定理,又与 Richard Taylor 花费近一年时间修补,最终在 1994 年完成证明。困扰数学界 350 多年的命题终于被攻克。

然而,数学界随后又给自己挖了一个更工程化的坑——能否让计算机也百分之百确认这份证明成立?
简单理解,普通数学论文是写给数学家看的,人脑看到很多步骤可以直接说「这里显然成立」。但 Lean 这种证明助手不吃这一套。我们可以将 Lean 理解成数学世界里的「超级严格编译器」——数学家或 AI 负责把定理、定义和证明一步一步写成 Lean 能够理解的形式,Lean 则负责检查每一个推导是否从前面的公理和定理合法地走出。
这也是为什么形式化一个大型现代数学证明,工作量经常大得惊人。
2000 年代,计算机科学家就已提出过形式化 Wiles 证明的设想。到 2024 年,帝国理工学院 Kevin Buzzard 等人才正式启动一个多年社区项目,准备使用 Lean 完成费马大定理形式化,仅项目第一阶段的技术蓝图就写了 86 页。

Anthropic 研究员 Tianyi Peng 最初其实没打算一口气干完这件事。作为昔日的信息学竞赛尖子,Tianyi Peng 曾获全国青少年信息学奥赛选拔赛第八名,2017 年从清华姚班本科毕业,2023 年获 MIT 博士学位,如今是哥伦比亚大学助理教授、Anthropic 研究员,长期聚焦强化学习、AI Agent 与形式化工具。
他只是想测试一下 Claude 究竟能把该项目往前推多远。最后,没成想 Claude 直接一路干到了终点。

整个过程中,不同 Agent 被同时拉起并行工作:有的负责补数学定义,有的专门攻中间引理,有的沿着已有成果继续往更高层定理推进,还有的 Agent 负责把不同部分重新拼回整个证明体系。
最终成果是约 1300 万行 Lean 代码、超过 3 万个中间定理。这个代码量甚至超过 Lean 核心数学库 Mathlib 自身规模的 5 倍。
Anthropic 表示,完整证明只依赖 Lean 三个标准公理,而且他们专门通过比较程序确认,Claude 最终证明的定理陈述与 Mathlib 里的费马大定理完全一致。也就是说,在逻辑检查这件事上,不能靠模型自己说「我证明完了」。
不过 Claude 这 11 天也没一路开挂到底。项目刚开始时,多 Agent 协作很快撞上了如今几乎所有大型 Agent 系统都会遇到的问题——人一多、活一多,项目就开始乱了。Anthropic 透露,早期 Agent 虽然很快拿下了一些结果,但随着工程规模扩大,它们逐渐跟不上整个项目的状态,也越来越难有效协作。这些失败尝试留下的代码,最终只占成品非模板代码的大约 7%。
真正的转折点是团队换上了名为「Prove2Me」的平台——这是 Tianyi Peng 及其哥伦比亚大学合作者专门为数学形式化搭建的协作系统。可以把它理解成给几十个 Claude 装上了一套数学版项目管理系统。

Prove2Me 会把整个证明拆成一个由定理节点组成的 DAG(有向无环图)。哪个定理已经证明了、哪个还缺前置条件、下一步该攻哪个节点,Agent 都能从这张图里判断。同时,平台还会把定理陈述和证明分开管理、加速 Lean 编译,并给每个定理保留自然语言描述,方便不同 Agent 搜索和复用已有结果。这一下,多 Agent 才真正开始像一支能协作的大型数学团队。
最终使用的方案是 Prove2Me + 基于 Claude Code 的 multi-agent harness。整个项目消耗约 60 亿个输出 Token,内部使用的通用研究模型能力大致相当于 Claude Fable 5.1。
更夸张的是,人类在过程中提供的数学指导相当有限。Tianyi Peng 更多只是偶尔给一些非常高层的提示,比如某个方向优先级更高、某个定理尽快推进。剩下的大量定义、中间证明、任务拆分和拼装主要由 Claude 自己完成。
负责审阅结果的 Kevin Buzzard 将其评价为一次「非凡的自动形式化成果」。

因为费马大定理的价值已不止于又被 AI 证明了一遍——如果这样规模、这样依赖复杂度的现代数学成果都开始能够被 AI 自动搬进形式化系统,那么过去极度依赖人工、推进速度缓慢的数学文献形式化,可能第一次真正具备了大规模提速的条件。
Claude 用 11 天把 350 多年的数学名题重新「喂」给计算机验了一遍。OpenAI 那边也没闲着——GPT-6 Astra 开始向更多人手里放了。
OpenAI 最新信息显示,GPT-6 Astra 正在逐步向 ChatGPT 付费用户开放。其中 GPT-6 Pro 面向 Pro、Business 和 Enterprise 计划推出,Pro 用户还可以在 Chat、Work 和 Codex 里使用 Astra。Sam Altman 也亲自出来吆喝了一波。

值得注意的是,OpenAI 新模型 Astra 重点强化的也是如今各家最卷的那几项能力——长链路 Agent 任务、软件工程、计算机操作、浏览器使用,以及科学和专业工作。
Anthropic 刚秀完 Claude 可以带着一群 Agent 狠干 11 天数学工程,OpenAI 转头开始把新旗舰往 Pro 和企业用户手里推。一大批刚出炉的数学、科研和 Agent 狠活,估计已经跟着 GPT-6 Astra 一起在路上了。
[1] https://x.com/search?q=费马大定理&src=typed_query
[2] https://www.anthropic.com/research/formalizing-fermats-last-theorem