Gemini 最新版本在 IMO 获得金牌成绩,展示了突破性的复杂推理能力。
Thang Luong 和 Edward Lockhart
国际数学奥林匹克竞赛("IMO")是世界上最负盛名的青年数学家竞赛,自1959年起每年举办一次。参赛的各国各派出六名精英中学数学家,竞相解决代数、组合数学、几何和数论领域中六道异常困难的问题。奖章颁发给排名靠前的一半参赛者,其中约8%的人获得享有盛誉的金牌。
近年来,IMO也逐渐成为AI系统的一个理想挑战,用来测试其先进的数学问题求解和推理能力。去年,Google DeepMind的AlphaProof和AlphaGeometry 2联合系统达到银牌水平,解决了六道题中的四道,获得28分。该突破利用了专门的形式化语言,展示了AI开始接近精英人类数学推理水平的潜力。
今年,我们成为首批获得IMO协调员按照学生解答相同标准正式评分和认证的系统。为了表彰今年参赛学生的卓越成就,我们现在迫不及待地与大家分享Gemini突破性表现的好消息。
Gemini Deep Think的高级版本完美解决了六道IMO题目中的五道,总共获得35分,达到金牌水平的表现。相关解答已在网上公布。
这一成就相比去年的突破性成果有了重大进步。在IMO 2024中,AlphaGeometry和AlphaProof需要专家首先将问题从自然语言翻译成领域特定语言(如Lean),然后再将证明翻译回自然语言。此外,整个计算过程耗时两到三天。而今年,我们的Gemini高级模型全程采用自然语言,直接从官方问题描述生成严谨的数学证明——所有这一切都在4.5小时的竞赛时限内完成。
我们通过使用Gemini Deep Think的高级版本实现了今年的成果——这是一种针对复杂问题的增强推理模式,融合了我们最新的研究技术,包括并行思考。这种设置使模型能够同时探索和组合多个可能的解决方案,然后给出最终答案,而不是只遵循单一的线性思路。
为了充分发挥Deep Think的推理能力,我们还对这个版本的Gemini进行了新型强化学习技术的训练,能够利用更多的多步骤推理、问题求解和定理证明数据。我们还为Gemini提供了一个精心策划的数学问题高质量解答语料库,并在其指令中添加了一些关于如何解决IMO问题的通用提示和建议。
我们将向包括数学家在内的一组受信任的测试者提供这个Deep Think模型的版本,然后再向Google AI Ultra订阅者推出。
Google DeepMind与数学社区有着持续的合作,但我们仍然只是刚刚开始探索AI对数学的贡献潜力。通过教导我们的系统更灵活和直观地推理,我们越来越接近构建能够解决更复杂、更高等数学的AI。
虽然我们今年的方法基于Gemini的纯自然语言,但我们也在继续推进形式化系统AlphaGeometry和AlphaProof的研究。我们相信,那些将自然语言流畅性与严谨推理相结合的agent——包括形式化语言中经过验证的推理——将成为数学家、科学家、工程师和研究人员的宝贵工具,帮助我们在通往AGI的道路上推进人类知识的发展。
我们感谢国际数学奥林匹克竞赛组织的支持。
这个项目是一次大规模协作,其成功归功于许多个人和团队的共同努力。Thang Luong领导了IMO 2025工作的总体技术方向,并与Edward Lockhart共同领导总体协调工作。
IMO 2025团队的领导和主要贡献者如下:Dawsen Hwang、Junehyuk Jung、Jonathan Lee、Nate Kushman、Pol Moreno、Yi Tay、Lei Yu、Golnaz Ghiasi、Garrett Bingham、Lalit Jain、Vincent Cohen-Addad和Theophane Weber、Ankesh Anand、Steven Zheng、Vinh Tran、Vinay Ramasesh、Andreas Kirsch、Jieming Mao、Zicheng Xu、Wilfried Bounsi、Vahab Mirrokni、Hoang Nguyen、Fred Zhang、Mahan Malihi、Yangsibo Huang、Yuri Chervonyi、Trieu Trinh、Junsu Kim、Mirek Olšák、Marcelo Menegali、Xiaomeng Yang、Richard Song、Miklós Z. Horváth、Aja Huang、Goran Žužić。
具有Deep Think功能的Gemini高级模型用于IMO的开发基于Deep Think团队的基础研究,并由GDM Thinking部门赞助,以及相应的后期训练工作,包括:Archit Sharma、Shubha Raghvendra、Tong He、Pei Sun、Tianhe (Kevin) Yu、Eric Ni、Siamak Shakeri、Hanzhao (Maggie) Lin、Cosmo Du、Sid Lall、Le Hou、Yuan Zhang、Yujing Zhang、Yong Cheng、Luheng He和Chenxi Liu。
该工作由Quoc Le和Pushmeet Kohli指导,由Kristen Chiafullo和Alex Goldin负责项目管理。
我们还要感谢为提供数据和评估做出贡献的专家:Insuk Seo(负责人)、Jiwon Kang、Donghyun Kim、Junsu Kim、Jimin Kim、Seongbin Jeon、Yoonho Na、Seunghwan Lee、Jihoo Lee、Younghun Jo、Yongsuk Hur、Seongjae Park、Kyuhyeon Choi、Minkyu Choi、Su-Hyeok Moon、Seojin Kim、Yueun Lee、Taehun Kim、Jeeho Ryu、Seungwoo Lee、Dain Kim、Sanha Lee、Hyunwoo Choi、Aiden Jung、Youngbeom Jin、Jeonghyun Ahn、Junhwi Bae、Gyumin Kim、Nam Dung Tran、Quoc Ba Can Vo、Van Huyen Nguyen、Tuan Anh Nguyen、Thanh Dat Vo、Nguyen Nam Hung Tran、Van Khai Luong、Son Vu、Son Tra Dao、Dai Dinh Phong Tran、Thanh Dat Le、Cheng-Chiang Tsai、Kari Ragnarsson、Kiat Chuan Tan、Yahya Tabesh、Hamed Mahdavi、Azin Nazari、Chu-Lan Kao、Steven Creech、Tony Feng、Daogao Liu和Ciprian Manolescu。
还要感谢以下人员的支持、协作和建议:Omer Levy、Timothy Lillicrap、Jack Rae、Yifeng Lu、Heng-tze Cheng、Denny Zhou、Ed Chi、Vahab Mirrokni、Tulsee Doshi、Madhavi Sewak、Melvin Johnson、Fernando Pereira、Benoit Schillings、Koray Kavukcuoglu、Oriol Vinyals、Jeff Dean、Demis Hassabis、Sergey Brin、Jessica Lo、Sajjad Zafar、Tom Simpson、Jane Labanowski、Andy Forbes、Sean Nakamoto、Jonathan Lai、Fabian Pedregosa、Samuel Albanie、Alex Zhai、Sara Javanmardi、Divy Thakkar、YaGuang Li、Nigamaa Nayakanti、Chenjie Gu、Chenkai Kuang、Swaroop Mishra、Filipe Miguel de Almeida、Silvio Lattanzi、Ashkan Norouzi Fard、Tal Schuster、Ziwei Ji、Honglu Fan、Xuezhi Wang、Aditi Mavalankar、Tom Schaul、Rosemary Ke、Xiangzhuo Ding、Adam Brown、Emanuel Taropa、Charlie Chen、Joe Stanton、Cip Baetu、Alvin Abdagic、Federico Lebron、Ioana Mihailescu、Soheil Hassas Yeganeh、Ashish Shenoy和Minh Giang。
最后,我们感谢IMO委员会的Gregor Dolinar教授的支持和认可。
IMO已确认我们提交的答案是完整且正确的解答。需要指出的是,他们的审查不涉及验证我们的系统、流程或底层模型(详见此处)。
Gemini在国际大学生程序设计竞赛世界总决赛中实现金牌水平