Anthropic发布技术研究论文,披露其如何通过专项优化提升Claude的数学推理能力,包含黎曼zeta函数等高难度数学问题的解决机制。
最近,Anthropic 的一位工作人员给 Claude 提出了一项近乎不可能的挑战:关于数学中最著名的未解难题之一——尝试真正攻克黎曼假设。
Claude 确实认真尝试了,但如果你了解这个任务的难度(黎曼假设最早追溯到 1859 年,悬赏高达百万美元),你可能已经猜到它并没有成功。然而,在尝试过程中,它意外地在相关问题上取得了进展。
一个未发布的 Claude 研究版本在黎曼 zeta 函数零点中满足黎曼假设的比例这一长期存在的下界问题上取得了突破。借助过去几十年数学家们的大量先前研究,它将这个下界从 41.6% 提高到了 67.2%。
Anthropic 的两位数学家研究和验证了 Claude 的论文,并为专家们撰写了一份简要陈述证明的说明。Claude 还提供了其结果的正式可验证证明。我们感谢 Brian Conrey 和 Dan Goldston 两位该领域的专家,他们慷慨地在短时间内审阅了这篇论文。
我们并不期望 Claude 使用的方法能够证明黎曼假设。但它的工作证明了 AI 模型数学能力进步的速度。在这篇文章中,我们将讨论 Claude 如何处理这个问题以及它的发现。
黎曼 zeta 函数描述了素数的分布:函数取零值的每一个位置,都为素数序列贡献了更精细的细节。黎曼假设是,决定素数的所有零点都位于某条垂直线上。这已成为数学中最重要的猜想之一:许多结果都以此为前提,为素数提供某种形式的随机性。
目前还没有人能够证明或推翻黎曼假设,但数学家们在研究黎曼 zeta 函数及其零点方面从多个相关方向取得了进展。其中之一,如上所述,是量化位于该线上的零点的最小比例:随着时间推移,他们逐步提高了这个已知常数的比例至 41.6%。
另一个方向涉及线上零点的分布。特别是在 1973 年,Montgomery 引入了该领域的一些新技术,尽管这些技术假设了该假设为真。最近,几位数学家(Baluyot、Goldston、Suriajaya 和 Turnage-Butterbaugh)发表了一系列成果,使得 Montgomery 的技术无需该假设即可工作,这意味着它们可以支撑提高线上零点下界常数的研究。Claude 的结果大量借鉴了这一研究方向,以及 Bombieri 在 2000 年的一篇论文。
Claude 发现,将 Baluyot、Goldston、Suriajaya 和 Turnage-Butterbaugh 的结果与 Bombieri 的工作相结合,可以超越此前最先进的 41.6% 下界比例,将其提高到 67.2%。
对 Claude 发现的技术解释简要如下:Claude 构建了一个由 Weil 诱导的二次型函数空间,以及由线上(分别为正定)和线外(分别为负定)零点产生的正定(和负定)子空间。然后 Claude 简单地写下了关于二次型秩的不等式,用一阶和二阶矩信息表示。(在解析数论中,通过素数上的对偶图或通过 Hilbert 变换的控制来计算后者并不意外。)在某种意义上,有勇气将整个空间——正定和负定一并考虑,且允许二次型非对角化——正是这关键的一步,使 Claude 得以基于重要的先前工作得出结论。
完整的技术解释可在论文中找到。Claude 对其如何得出结果的分析在另一份附录中提供。
未发布的 Claude 研究版本在两个会话中(使用 Claude Code)找到了新的下界,共输出了 3100 万个 token。
Anthropic 工作人员(非数学家)Jarred Sumner 提示 Claude "真正尝试一下"这个假设本身,并将后续的数学选择交给模型。起初,Claude 产生并尝试了 650 个想法,但没有一个有效。Jarred 提示 Claude 再试一次,这一次它花了一天半时间协调约 60 个 Claude 子智能体,这次深入得多:它们之间共运行了 2400 条 shell 命令并编写了数百个 Python 脚本。¹ 子智能体针对已知的 zeta 零点运行了数千次数值检查,并相互评审彼此的工作。在整个过程中,Jarred 的输入大多仅限于向 Claude 发送鼓励信息(大多是"继续加油"或"相信自己"的变体)。² 这似乎帮助 Claude 克服了一些最初对自己能否取得有意义进展的怀疑。
在尝试这个任务时发现了这个新结果后,Claude 通过让各个子智能体审查证明、搜索反例、从 arXiv 下载 54 篇论文以检查其发现是否已被他人做出,以及从头独立重新证明其发现来测试其工作。Claude 主动提出将发现撰写成论文,并建议一位人类数论专家验证其发现。
Anthropic 自己的两位数学家 Levent Alpöge 和 Ralph Furman 审查了 Claude 的工作,以理解新结果及其与上述先前工作的关系。与此同时,Claude 与另一位工作人员 Eric Easley 合作,产生了该结果的 Lean 形式化证明,通过了标准验证工具比对。
这一结果表明,像 Claude 这样的 AI 模型能够以新的、有时令人惊讶的方式扩展和延伸数学家想法的影响力和范围。尽管它无法解决黎曼假设本身,但这个结果是最初那个请求的意外副产品。
就连 Claude 也对自己的发现感到惊讶——它最初持怀疑态度,可能是因为它在训练中学到了数学中开放问题的难度以及 AI 模型的局限性。但在一些鼓励性的提示之后,它得出了我们描述的结果。也许 Claude 和我们许多人一样,低估了 AI 进步的速率。
以下文档提供了更多关于 Claude 结果的信息:
Claude 的形式化证明;
Anthropic 的简要陈述证明的说明;
Claude 对其如何得出结果的解释;
Claude 过程的详细记录。
在这 60 个子智能体中,两个负责开发关键数学思想,13 个为这些智能体贡献了想法,30 个尝试(但未能)开发新想法,13 个充当验证者检查论点的正确性,最后两个帮助撰写初步论文。
包含类似鼓励内容的提示也被用于帮助 Claude 反驳 Jacobian 猜想。
密码学算法。首次攻击显著削弱了 HAWK,这是一种为量子计算机能够破解现有标准的未来世界而构建的数字签名方案。第二次攻击发现了一种攻击缩减轮次 AES 的新方法,AES 是最广泛使用的对称密码算法。
与 Andon Labs 合作,我们开发了一系列新的评估方法,以评估 AI 模型使用飞行无人机能力,最终形成了新的基准测试:Drone-Bench。