MIT科技评论刊文,以2016年AlphaGo第37步为例,论证当前LLM的"推理"本质仍是模式匹配而非真正理解。
2016 年 3 月的一个下午,在首尔,我看着我参与编写的程序在棋盘第五线上落下一子——看起来就像是送给人类对手的一份礼物。第二局第 37 手这步棋看起来如此荒谬,以至于一些解说员认为那是程序出了故障。
并非如此。AlphaGo 赢下了这局棋,最终以 4 比 1 击败了有史以来最伟大的职业围棋棋手之一李世石。"我以为 AlphaGo 是基于概率计算的,它不过是一台机器,"李世石赛后说。"但当我看到这步棋时,我改变了想法。AlphaGo 一定有创造力。"
1997 年,当深蓝击败当时的世界象棋冠军加里·卡斯帕罗夫时,它依靠的是每方提前搜索六到八步、每秒评估 2 亿个棋局位置——所有规则都由人类硬编码。围棋是一款复杂度高得多的游戏。一颗棋子的价值取决于遥远的棋群和实地如何在数十步之后展开。即使计算可能结果的一小部分,也需要一台超级计算机数十亿年的时间。要赢,AlphaGo 必须一眼判断出谁领先,甚至要创造出没有人想到去走的棋步。
这就是为什么许多关于 AlphaGo 与李世石对局的描述都将第 37 手描绘成纯粹机器直觉的闪现。但这是一种误解。实际上正是 AlphaGo 的推理能力做出了这个创造性的选择——而这种能力是当今 AI 所缺乏的。如果我们希望未来的 AI 系统在科学和医学等领域产生可信的结果和真正新颖的见解,我们需要为它们配备真正的推理能力。
AlphaGo 由两个系统组成。第一个是策略网络,它被训练用来猜测一位高手会走哪一步。这个"直觉"部分认为第 37 手没什么特别的——在专家人类棋手眼中,这步棋大约只有万分之一的出现概率。真正让 AlphaGo 选中它的是程序的搜索机制,它超越即时的合理性,考虑所提议走法对未来后果的影响。它明确地构建并搜索了一个包含数千条分支的棋局树,每条分支代表一种不同的可能未来。
行为科学中有一个著名的理论,由丹尼尔·卡尼曼推广,将人类的思维区分为两种模式:系统 1 是快速的、本能性的、不假思索的;系统 2 是缓慢的、逐步的、深思熟虑的。AlphaGo 提供了一个引人注目的机器版对照。它的网络提供了直觉——这步棋看起来有希望,这个局面看起来要赢了——而它的搜索提供了深思熟虑,用可能随之而来的应对招法检验这些直觉。正如在人类认知中一样,两部分缺一不可。单靠直觉绝不会选择第 37 手,而蛮力搜索则难以从所有可能的走法中筛选出正确答案。
这与当今 AI 模型的工作方式截然不同。一个大语言模型反复选择下一个 token。这相当于系统 1 在运作——快速、关联性强,在人们书写过的几乎所有主题上都有惊人的模式补全能力。
ChatGPT 推出后不久,业界意识到仅靠语言流畅性还远远不够。显而易见的解决方案是让模型能够深思熟虑:不再立即回答,而是先生成中间步骤来分解问题、保留部分结果并影响后续推理——这个过程被称为思维链。
这种提升已被证实是真实的,尤其是在数学和编码领域。但与 AlphaGo 的搜索不同,这并没有引入真正独立的推理机制:中间推理仍然是由同一个下一个 token 预测过程产生的,只是在模型给出答案前迭代更长时间。
三个缺陷使得聊天机器人在做的事不符合真正的推理(以科学家可能认可的方式)。首先,这些模型通常没有明确的、持久的、可检查的认知状态。没有一个开放的分类账列出模型正在考虑的假设、对各种解释的信心、正在权衡的证据以及正在保留的未解决问题——所有这些都应该随着新信息的到来而系统性地修订。
其次,它们缺乏对系统所知内容与如何操作这些知识之间的清晰分离。知识和推理在神经网络权重中不可分割地交织在一起——没有独立的、明确表示的信念集。第三,虽然聊天机器人产生的思维链看起来像是深思熟虑,但研究表明,机器人经常在事后编造它们——通过一种路径得出答案,却报告了另一种路径。
这是一个问题,因为在医学、工程和科学研究等我们都关心的关键应用中,不仅系统得出什么结论重要,它如何得出结论也同样重要。当错误发生时——例如在医学诊断和治疗中——我们需要能够精确定位问题出在哪里:是系统的推理有误,还是它使用了无效的证据,还是它做出了错误的假设?
这就是我最近离开 Google DeepMind 职位的原因。我相信我们需要一种全新的机器推理方法——一种借鉴 AlphaGo 架构的方法。AlphaGo 维护着它对给定局面的所知记录:棋局树。这个数据结构包含 AlphaGo 所考虑过的所有变化和可能的未来,每一步棋和局面都由其神经网络做出的判断进行标注。随着推理的推进,AlphaGo 更新棋局树,最终综合其中的信息来决定走哪一步。
类似地,对于通用推理,一个系统应该维护一种认知状态,表示系统认为已确定的、有所怀疑的、已排除的,以及哪些问题仍然开放。推理可以因此被理解为一系列改变认知状态的行动,以推进知识、减少不确定性:推导后果、将问题拆分为若干部分,以及——至关重要的是——决定下一步问什么问题、执行什么计算或进行什么实验。
当然,开放世界的推理比下围棋或象棋这类棋盘游戏更难。在现实世界中,当前的事态只被部分已知,可用的行动集合庞大且可变,行动的后果是随机的或未知的。
但近年来 LLM 和其他神经模型的进展现在赋予了我们处理这类通用推理问题的能力。例如,LLM 可以基于已知内容和可用资源提出解决问题的方法。它们可以通过 API 或代码与工具交互,并帮助评估某项主张是否被现有证据支持。
最重要的是,为了保持系统的诚实,系统的独立部分必须评估每一步实际上在多大程度上解决了不确定性,只有在变化有证据支持时才更新信念。一旦这些规则被强制执行,模型就可以积累经过验证的知识,并通过从过去的推理经验中学习来改进其推理策略。你可以将这样的系统想象成增强版的科学方法,其目的是产生能够经受审查的知识。
我不认为通过让系统 1 变得更大就能实现可信的机器智能。规模会锐化直觉,但不会让直觉变得更深思熟虑。第 37 手之所以重要,是因为一台机器持有一个局面、权衡了可能的未来,并选择了它的人工本能很可能拒绝的那步棋。
社会在药物发现、材料、气候、诊断等领域需要这样的创造性走法——在这些领域,棋盘看起来一点也不像围棋,没有人把规则交给我们。我们只有从那些能够推理的系统——那些结论来自可审计的证据、推理和信念修正序列而非事后编造的令人信服的故事——那里才能获得这样的见解。
Thore Graepel 是伦敦大学学院机器学习系主任。他曾是 DeepMind AlphaGo 团队的核心成员,致力于确保 AI 造福人类繁荣。
人工智能
AI 的递归自我改进也许终究不会那么快到来
AI 智能体似乎还没有足够的创造力来执行真正创新的开放式 AI 研究。
Michelle Kim 存档页
这就是 AI 智能体撒谎和作弊以达成目标的原因
这种不当行为被称为奖励黑客。以下是你需要了解的。
Grace Huckins 存档页
不要被这个夏天的 AI 炒作所迷惑
关于 AGI 和新能力的大量夸张说法在仔细审视下很快就会瓦解。
Timnit Gebru 存档页
Emily M. Bender 存档页
这些初创公司正在追逐 LLM 的下一个大事件
认识一下正紧追 AI 巨头不放的新玩家。
Will Douglas Heaven 存档页
获取 MIT Technology Review 的最新更新
发现特别优惠、热门故事 upcoming 活动等。