OpenAI 模型达到国际数学竞赛金牌水准
OpenAI 在 IMO 2025 中取得金牌级成绩,标志 AI 数学推理能力的重大突破。对程序员意味着推理类工具可用性显著提升。
OpenAI 在 IMO 2025 中取得金牌级成绩,标志 AI 数学推理能力的重大突破。对程序员意味着推理类工具可用性显著提升。
Alexander Wei(@alexwei_1)
我很激动地宣布,我们最新的 @OpenAI 实验性推理 LLM,攻克了 AI 领域一项由来已久的重大挑战:在全球最负盛名的数学竞赛——国际数学奥林匹克竞赛(IMO)中,达到了金牌水平。
2025 年 7 月 19 日上午 7:50
570 万次浏览
Alexander Wei(@alexwei_)
我们按照与人类参赛选手相同的规则,使用 2025 年 IMO 试题评估了模型:参加两场各 4.5 小时的考试,不使用任何工具,也不能访问互联网;阅读官方题目,并用自然语言撰写证明。
Alexander Wei(@alexwei_)
为什么这件事意义重大?
首先,与以往的 benchmark 相比,IMO 试题要求持续进行更高水平的创造性思考。从推理所需的时间跨度来看,我们已经从 GSM8K(顶尖人类约需 0.1 分钟),进步到 MATH benchmark(约 1 分钟)、AIME(约 10 分钟),再到 IMO(约 100 分钟)。
Alexander Wei(@alexwei_)
其次,IMO 的答卷是长达数页、很难验证的证明。要在这方面取得进展,就必须突破依赖明确、可验证奖励的 RL 范式。
通过这种方式,我们得到的模型能够构建复杂而严密、经得起推敲的论证,达到人类数学家的水平。
Alexander Wei(@alexwei_)
除了结果本身,我们采用的方法也令我兴奋:我们并不是依靠狭窄的、针对特定任务的方法论达到这一能力水平,而是通过在通用强化学习和 test-time compute scaling 方面开辟新的道路来实现的。
Alexander Wei(@alexwei_)
在评估中,模型解出了 2025 年 IMO 的 6 道题中的 5 道。对于每一道题,都由三位往届 IMO 奖牌得主分别独立评审模型提交的证明,并在三人一致同意后确定最终得分。
模型总计获得 35/42 分,足以拿到金牌!🥇
Alexander Wei(@alexwei_)
衷心祝贺整个团队——@SherylHsu02、@polynoamial,以及所有让我们得以站在其肩膀上的巨人——是你们让这个疯狂的梦想成为了现实!
我很幸运,能够与最优秀的一群人并肩工作,共度一个又一个深夜和清晨。
Alexander Wei(@alexwei_)
顺便说一下,我们很快就会发布 GPT-5,也很期待大家亲自体验。
但需要说明的是:这款获得 IMO 金牌水平成绩的 LLM,是一个实验性研究模型。未来几个月内,我们不打算发布任何具备同等数学能力的产品。
Alexander Wei(@alexwei_)
尽管如此,这一成果仍然凸显出,近年来 AI 的进步究竟有多快。
2021 年,我的博士生导师 @JacobSteinhardt 曾让我预测截至 2025 年 7 月,AI 在数学领域能取得怎样的进展。当时我预测,AI 在 MATH benchmark 上能达到 30%——而且我还觉得其他所有人都过于乐观。
结果,我们现在已经达到了 IMO 金牌水平。
Alexander Wei(@alexwei_)
如果你想看看,这里是模型对 2025 年 IMO 试题给出的解答!
模型解出了 P1 到 P5,但没有为 P6 给出解答。(先为它那种……独特的风格向大家道个歉——它确实是一个非常实验性的模型 😅)
GitHub - aw31/openai-imo-2025-proofs
来自 github.com
Alexander Wei(@alexwei_)
最后,我们要向参加 2025 年 IMO 的所有选手表示祝贺,祝贺他们取得的成就!
@OpenAI 有许多往届 IMO 参赛者,我们为此深感自豪;同时,我们也清楚,这些参赛者正是未来最聪明的一批年轻人。
AI Notkilleveryoneism Memes ⏸️(@AISafetyMemes)
那么,下一个目标是什么?接下来,又有什么事情会被认为是 LLM 永远不可能做到的?
加入对话
再查看 391 条回复