AlphaGo 十年:从游戏到科学发现
Google DeepMind 总结 AlphaGo 在游戏、生物学、科学发现中的深远影响。高质量行业总结,对理解 AI 演进有启发价值。
Google DeepMind 总结 AlphaGo 在游戏、生物学、科学发现中的深远影响。高质量行业总结,对理解 AI 演进有启发价值。
十年前,我们的 AI 系统 AlphaGo 成为首个在复杂的围棋比赛中击败世界冠军的程序——这一里程碑比许多专家预想的提前了整整十年。
这项成就宣告了如今公认的人工智能(AI)现代时代的开启。凭借一次极具创造力的落子——著名的“第 37 手”(Move 37)——AlphaGo 展示了 AI 的潜力,也表明我们已经掌握了开始攻克现实世界科学问题所需的技术。
时至今日,这项突破仍在影响我们构建通往通用人工智能(AGI)之路上的系统。我们相信,AGI 将成为人类有史以来最具深远影响的技术,并可能成为推动科学、医学和生产力进步的终极工具。
2016 年,超过 2 亿人观看了 AlphaGo 在首尔对阵围棋世界冠军李世石的比赛。这场对决因第二局的“第 37 手”而载入史册:这步棋极其反常,以至于职业解说起初认为它是一次失误。但事实证明,它是决定胜负的关键。大约一百手之后,那枚棋子恰好处在帮助 AlphaGo 赢下比赛的正确位置。这一幕展现了惊人的远见,也证明 AI 系统能够超越对人类专家的模仿,找到全新的策略。
围棋极其复杂,因此长期以来一直是检验 AI 研究成果的试验场。棋盘上可能出现的局面多达 10^170 种——远远超过可观测宇宙中的原子数量。
为了让这个问题变得可处理,AlphaGo 将深度神经网络与高级搜索和强化学习结合起来——强化学习正是 DeepMind 开创的一种 AI 方法。
AlphaGo 首先通过学习人类专家的棋局,建立一套合理落子的模型;随后与自己对弈数十万局,通过强化最有可能获胜的策略不断进步。之后,系统只考虑最可能产生良好结果的路径,并从这个规模更小的候选落子集合中,找到最有可能带领它获胜的那一步棋。
继 AlphaGo 之后,我们开发了 AlphaGo Zero。它完全从随机对弈开始学习,最终成为堪称历史上最强的围棋棋手。随后,我们又通过 AlphaZero 进一步泛化了这一系统,使它能够从零开始,自学并掌握任何双人完全信息博弈,包括围棋、国际象棋和将棋。除了游戏规则之外,AlphaZero 没有任何先验知识,却能在短短数小时内掌握国际象棋,不仅击败了最顶尖的人类棋手,也战胜了当时最强的国际象棋专用程序,例如 Stockfish。尽管人们早已借助这些程序对国际象棋进行了极其深入的分析,但与围棋一样,AlphaZero 依然能够提出令人耳目一新的策略。
这进一步印证了我们在首尔赢下那场比赛时,我便已经意识到的事情:这项技术已经能够用于实现我们真正的目标——加速科学突破。
AlphaGo 证明了自己能够驾驭围棋棋盘庞大的搜索空间,也由此展示了 AI 帮助我们深入理解物理世界无穷复杂性的潜力。我们首先尝试解决蛋白质折叠问题。这是一项延续了 50 年的重大挑战,目标是预测蛋白质的三维结构——这类信息对于理解疾病和开发新药至关重要。
2020 年,我们终于通过 AlphaFold 2 系统破解了这个困扰科学界已久的问题。此后,我们预测了科学界已知全部 2 亿种蛋白质的结构,并通过一个开源数据库向科学家免费开放。如今,全球已有超过 300 万名研究人员使用 AlphaFold 数据库,加速从疟疾疫苗到塑料降解酶等各类重要研究。2024 年,John Jumper 和我有幸代表整个 AlphaFold 团队,因领导这一项目而获得诺贝尔化学奖——这是我一生中至高无上的荣誉。
自 AlphaGo 获胜以来,我们已将其开创性方法应用于科学和数学的许多其他领域,包括:
数学推理:AlphaProof 是 AlphaGo 架构最直接的继承者。它将语言模型与 AlphaZero 的强化学习和搜索算法结合起来,学习如何证明形式化数学命题。它与 AlphaGeometry 2 一道,成为首个在国际数学奥林匹克竞赛(IMO)中达到奖牌标准(银牌)的系统。这证明 AlphaGo 的方法能够解锁高级数学推理能力,也为我们能力最强的通用模型奠定了基础。
我们规模最大、能力最强的模型 Gemini 最近又向前迈进了一步。其 Deep Think 模式的一个高级版本采用受 AlphaGo 启发的方法,在 2025 年 IMO 中达到了金牌水平。此后,Deep Think 又被应用于科学和工程领域更加复杂、更加开放的问题。
算法发现:正如 AlphaGo 会在棋局中搜索最佳落子一样,我们的 coding agent AlphaEvolve 会探索计算机代码空间,从中发现效率更高的算法。它也迎来了属于自己的“第 37 手”时刻:找到了一种全新的矩阵乘法方法。矩阵乘法是一项基础数学运算,为几乎所有现代神经网络提供支撑。如今,AlphaEvolve 正在接受测试,用于解决从数据中心优化到量子计算等一系列问题。
科学协作:我们正在把 AlphaGo 开创的搜索和推理原则集成到一个 AI co-scientist 中。通过让多个 Agent “辩论”科学观点和假设,这套系统能够充当研究协作者,进行识别数据模式和解决复杂问题所必需的严谨思考。在伦敦帝国理工学院开展的验证研究中,它分析了数十年的文献,并独立得出了一个有关抗菌药物耐药性的相同假设——而研究人员此前花费数年时间才提出这一假设,并通过实验完成验证。
我们还利用 AI 更深入地理解基因组、推进聚变能源研究、改进天气预测等。
我们的科学模型固然令人印象深刻,但它们的专业化程度很高。要实现创造无限清洁能源,或攻克今天尚不了解的疾病等根本性突破,我们需要通用 AI 系统。这样的系统能够发现不同学科领域之间的底层结构与联系,并像最优秀的科学家一样,帮助我们提出新的假设。
要让 AI 真正具备通用能力,它就需要理解物理世界。我们从一开始就将 Gemini 构建为多模态模型,使它不仅能够理解语言,还能理解音频、视频、图像和代码,从而建立一个世界模型。
为了跨越这些模态进行思考和推理,最新的 Gemini 模型采用了我们通过 AlphaGo 和 AlphaZero 开创的部分技术。
下一代 AI 系统还需要具备调用专用工具的能力。例如,如果一个模型需要了解某种蛋白质的结构,它就可以使用 AlphaFold。
我们认为,将 Gemini 的世界模型、AlphaGo 的搜索与规划技术,以及专用 AI 工具的使用结合起来,将成为实现 AGI 的关键。
真正的创造力,是这类 AGI 系统必须展现的一项核心能力。“第 37 手”让我们初次窥见了 AI 打破常规思考的潜力,但真正的原创性发明还需要更多能力。它不仅要能像 AlphaGo 那样出色地提出一种全新的围棋策略,还要能真正发明出一种像围棋一样深邃、优雅并值得研究的游戏。
在 AlphaGo 取得传奇胜利十年之后,我们的终极目标已经出现在地平线上。“第 37 手”中最初显现的创造火花,催化了一系列如今正在汇聚的突破,为通往 AGI 的道路铺平了方向,也将开启科学发现的新黄金时代。