Gemini Deep Think 在科学计算中的突破
Google 发布 Gemini Deep Think 在数学和科学领域的实际应用案例,展示深度推理能力对科学发现的加速效果。
Google 发布 Gemini Deep Think 在数学和科学领域的实际应用案例,展示深度推理能力对科学发现的加速效果。
Thang Luong 和 Vahab Mirrokni
在数学家和科学家专家的指导下,Gemini Deep Think 正在解决跨越数学、物理和计算机科学的专业研究问题
在 2025 年夏天,Gemini Deep Think 的高级版本在国际数学奥林匹克竞赛(IMO)中达到了金牌水准,随后更新的版本在国际大学生程序设计竞赛中获得了类似的成绩。这些结果表明该模型能够推理通过为学生设计的一些最具挑战性的数学和编程问题。从那以后,Gemini Deep Think 模式已经进入科学、工程和企业工作流,以应对更加复杂、开放式的挑战。
在上一周,我们的团队发表了两篇论文(1、2),详细说明了一项使用 Gemini Deep Think 模式解决专业研究问题的跨学科工作。这些成果来自于数学家、物理学家和计算机科学家之间的深度合作。
与 IMO 问题不同,研究级别的数学需要来自庞大文献的高级技术。虽然基础模型拥有庞大的知识库,但数据稀缺往往导致对高级主题的肤浅理解和幻觉。
为了解决这个问题,我们构建了一个数学研究 agent(内部代号 Aletheia),由 Gemini Deep Think 模式驱动。它配备了一个自然语言验证器,用来识别候选解决方案中的缺陷,并实现一个生成和修改解决方案的迭代过程。至关重要的是,该 agent 能够承认无法解决问题,这一关键特性提高了研究人员的效率。
此外,研究 agent 还使用谷歌搜索和网络浏览来应对复杂的研究,防止在综合已发表文献时出现虚假引用和计算不准确。
自 2025 年 7 月达到 IMO 金牌水准以来,Gemini Deep Think 发展迅速,随着推理时计算能力的增加,在 IMO-ProofBench Advanced 测试中的得分高达 90%。我们证明了当我们超越奥林匹克级别进入博士级别练习(根据我们内部的 FutureMath Basic 基准)时,缩放规律仍然成立。值得注意的是,Aletheia 证明了在较低的推理时计算下也能实现更高的推理质量。
对于研究级别的数学,Aletheia 已经通过不同程度的自主研究实现了多项进展:
可靠的自主研究。 一篇由 AI 在完全没有人工干预的情况下生成的研究论文(Feng26),它计算了算术几何中的某些结构常数,称为特征值。
AI 引导的协作。 一篇研究论文(LeeSeo26)展示了人类与 AI 在证明相互作用的粒子系统(称为独立集)界的协作。
对 Bloom 的 Erdős 猜想数据库中 700 个开放问题的广泛半自主评估(Feng et al., 2026b),包括对其中四个开放问题的自主解决方案。在 Erdős-1051 上,我们的模型自主解决并帮助导出了一项在研究论文(BKKKZ26)中报告的推广。
该 agent 还为进一步的两篇论文(FYZ26 和 ACGKMP26)贡献了中间命题。值得注意的是,之前也有使用 Gemini 进行研究级别数学的工作,但在协作规模和所解决问题的数量方面较小。
经过与数学界的广泛讨论,我们提出了一个分类法,根据显著性和 AI 贡献程度对 AI 辅助数学研究进行分类——有助于更广泛的讨论,涉及 AI 生成结果的负责任记录、评估和交流。第 2 级("可发表质量")的工作已提交至声誉良好的期刊。目前,我们不声称有任何第 3 级("重大进展")和第 4 级("里程碑式突破")的结果。
提示词和模型输出可在此处获取。有关 AI 贡献、我们的"人机交互卡"和社区影响的讨论,请参见我们的论文。
Gemini Deep Think 模式在计算机科学和物理学中也展现了前景。第二篇论文基于类似的 agent 推理思想,并识别了有效的协作"食谱",特别是"顾问"模型,其中人类通过迭代的"Vibe-Proving"循环引导 AI 来验证直觉并优化证明。我们也详细说明了战术技术,如"平衡提示"——同时请求证明或反驳以防止确认偏差——以及代码辅助的验证。这些方法,加上模型通过深层结构联系桥接不同科学领域的能力,正在改变理论研究的进行方式。这项工作基于我们成功部署 Gemini Deep Think 高级版本来协助审查 STOC'26 会议 CS 理论论文的经验。
在与专家合作的 18 个研究问题上,Gemini Deep Think 的高级版本帮助解决了算法、ML 和组合优化、信息论和经济学等领域的长期存在的瓶颈。我们"用 Gemini 加速研究"论文的亮点包括(论文中的相应部分编号):
跨越网络谜题的数学边界: 在"最大切割"(有效分割网络)和"Steiner 树"(连接高维点)等经典计算机科学问题上的进展已经放缓。Gemini 通过跳出思维框框打破了两个僵局。它通过从完全不相关的连续数学分支中提取高级工具——如 Kirszbraun 定理、测度论和 Stone-Weierstrass 定理——来解决这些离散算法谜题。见第 4.1 和 4.2 部分。
解决在线子模优化中十年前的猜想: 2015 年的一篇理论论文提出了一个似乎很明显的数据流规则:制作到达项目的副本总是不如简单移动原始项目有价值。专家们为此苦恼了十年以证明这一点。Gemini 设计了一个高度具体的三项组合反例,严格地证明了长期存在的人类直觉是错误的。见第 3.1 部分。
机器学习优化: 训练 AI 过滤噪声通常需要工程师手动调整一个数学"惩罚"。研究人员创建了一种自动执行此操作的新技术,但无法从数学上解释原因。Gemini 分析了方程并证明了该方法通过秘密生成自己的"自适应惩罚"来成功。见第 8.3 部分。
升级 AI 的经济理论: 最近的"启示原理"用于拍卖 AI 生成令牌,仅当出价限制为有理数时在数学上有效。将域扩展到连续实数使原始证明无效。Gemini 采用了先进的拓扑和序理论来扩展定理,适应现实世界中的连续拍卖动态。见第 8.4 部分。
宇宙弦物理学: 计算来自宇宙弦的引力辐射需要找到包含"奇点"的棘手积分的解析解。Gemini 使用 Gegenbauer 多项式找到了一个新的解。这自然地吸收了奇点,将无限级数坍缩为一个闭形式、有限和。见第 6.1 部分。
跨越多个领域——从信息和复杂性理论到密码学和机制设计——这些结果展示了 AI 如何从根本上改变了研究。详见我们的论文。
鉴于计算机科学流动的、由会议驱动的出版流程,我们通过学术轨迹而非僵硬的分类法来描述这些结果。大约一半针对强大的会议——包括 ICLR '26 的接受——而大多数其余的发现将形成未来的期刊投稿。即使是在通过识别错误(第 3.2 部分)或反驳猜想(第 3.1 部分)来纠正该领域的过程中,这些成果也突出了 AI 作为高级科学合作者的价值。
基于谷歌之前的突破(1、2、3、4、5),这项工作证明了通用基础模型——配合 agent 推理工作流——可以充当强大的科学伴侣。
在数学家、物理学家和计算机科学家专家的指导下,Gemini Deep Think 模式正在证明其在复杂数学、逻辑和推理是核心的领域中的效用。
我们正在见证科学工作流的根本转变。随着 Gemini 的演进,它充当了人类智力的"力量倍增器",处理知识检索和严格验证,以便科学家可以专注于概念深度和创意指导。无论是优化证明、寻找反例,还是连接不同的领域,AI 正在成为科学进步下一章中的有价值的合作者。
我们感谢数学家、物理学家和计算机科学家专家社区对该项目的帮助和建议。
该项目是跨谷歌的大规模协作,其成功归功于许多个人和团队的共同努力。Thang Luong 和 Vahab Mirrokni 领导了整体研究方向,从 Tony Feng 和 David Woodruff 获得了深厚的技术专长。
第一篇论文"走向自主数学研究"的作者包括:Tony Feng、Trieu H. Trinh、Garrett Bingham、Dawsen Hwang、Yuri Chervonyi、Junehyuk Jung、Joonkyung Lee、Carlo Pagano、Sang-hyun Kim、Federico Pasqualotto、Sergei Gukov、Jonathan N. Lee、Junsu Kim、Kaiying Hou、Golnaz Ghiasi、Yi Tay、YaGuang Li、Chenkai Kuang、Yuan Liu、Hanzhao (Maggie) Lin、Evan Zheran Liu、Nigamaa Nayakanti、Xiaomeng Yang、Heng-Tze Cheng、Demis Hassabis、Koray Kavukcuoglu、Quoc V. Le、Thang Luong。我们感谢以下专家提供的反馈和讨论:Jarod Alper、Kevin Barreto、Thomas Bloom、Sourav Chatterjee、Otis Chodosh、Michael Hutchings、Seongbin Jeon、Youngbeom Jin、Aiden Yuchan Jung、Jiwon Kang、Jimin Kim、Vjekoslav Kovač、Daniel Litt、Ciprian Manolescu、Mona Merling、Agustin Moreno、Carl Schildkraut、Johannes Schmitt、Insuk Seo、Jaehyeon Seo、Terence Tao、Cheng-Chiang Tsai、Ravi Vakil、Zhiwei Yun、Shengtong Zhang、Wei Zhang、Yufei Zhao。
第二篇论文"用 Gemini 加速科学研究:案例研究和常见技术"的作者包括 David P. Woodruff、Vincent Cohen-Addad、Lalit Jain、Jieming Mao、Song Zuo、MohammadHossein Bateni、Simina Branzei、Michael P. Brenner、Lin Chen、Ying Feng、Lance Fortnow、Gang Fu、Ziyi Guan、Zahra Hadizadeh、Mohammad T. Hajiaghayi、Mahdi JafariRaviz、Adel Javanmard、Karthik C. S.、Ken-ichi Kawarabayashi、Ravi Kumar、Silvio Lattanzi、Euiwoong Lee、Yi Li、Ioannis Panageas、Dimitris Paparas、Benjamin Przybocki、Bernardo Subercaseaux、Ola Svensson、Shayan Taherijam、Xuan Wu、Eylon Yogev、Morteza Zadimoghaddam、Samson Zhou、Yossi Matias、Jeff Dean、James Manyika、Vahab Mirrokni。该列表包括构建 Gemini 之上的 agent 推理的谷歌研究人员,以及验证和与 Gemini 协作的学术专家合作者。我们也感谢 Corinna Cortes 对论文的仔细审查。
我们感谢来自 DeepThink 团队其余部分的基础支持:Anirudh Baddepudi、Michael Brenner、Irene Cai、Kristen Chiafullo、Paul Covington、Rumen Dangovski、Chenjie Gu、Huan Gui、Vihan Jain、Rajesh Jayaram、Melvin Johnson、Rosemary Ke、Maciej Kula、Nate Kushman、Jane Labanowski、Steve Li、Pol Moreno、Sidharth Mudgal、William Nelson、Ada Maksutaj Oflazer、Sahitya Potluri、Navneet Potti、Shubha Raghvendra、James Roggeveen、Siamak Shakeri、Archit Sharma、Xinying Song、Mukund Sundararajan、Qijun Tan、Zak Tsai、Erik Wang、Theophane Weber、Winnie Xu、Zicheng Xu、Junwen Yao、Shunyu Yao、Adams Yu、Lijun Yu、Honglei Zhuang。
我们感谢 Gemini 后训练团队为 Deep Think 构建基础模型:Arash Ahmadian、Ankesh Anand、Charles Chen、Yong Cheng、Kedar Dhamdhere、Philipp Fränken、Justin Gilmer、Elena Gribovskaya、Luheng He、Yangsibo Huang、Rishabh Joshi、Ajay Kannan、Arvind Kannan、Guangda Lai、Robert Leland、Hanzhao (Maggie) Lin、Yingjie Miao、Bryce Petrini、Corbin Quick、Vikash Sehwag、Yue Song、Pranav Talluri、Ankur Taly、George Tucker、Michael Voznesensky、Manish Reddy Vuyyuru、Yiming Wang、Jinliang Wei、Qiao Zhang、Yuan Zhang、Zizhao Zhang。
我们感谢 Quoc Le、Koray Kavukcuoglu、Demis Hassabis、James Manyika、Yossi Matias 和 Jeff Dean 赞助了该项目。
最后但同样重要的是,我们感谢 Divy Thakkar、Adam Brown、Vinay Ramasesh、Alex Davies、Thomas Hubert、Eugénie Rives、Pushmeet Kohli、Benoit Schillings 对该项目的反馈和支持。
Gemini Deep Think 高级版本在国际数学奥林匹克竞赛中正式达到金牌水准
Gemini 在国际大学生程序设计竞赛世界总决赛中达到金牌水准