Opus 4.5能力探讨:从口袋妖怪的视角
用Pokémon示例来阐述Opus 4.5的推理能力。新颖的讲解角度,但讨论热度较低,实用性有限。
用Pokémon示例来阐述Opus 4.5的推理能力。新颖的讲解角度,但讨论热度较低,实用性有限。
你可能会惊讶地发现,ClaudePlaysPokemon 至今仍在继续运行,而在 Google 自豪地宣布 Gemini 2.5 Pro 通关《精灵宝可梦蓝》的半年多后,Claude 仍未通关《精灵宝可梦红》。实际上,自那以来,Google 和 OpenAI 的模型已经通关了更长、更复杂的《精灵宝可梦晶晶版》,但自 Claude 3.7 Sonnet 以来,Claude 在红版上没有取得任何实质性的进展![1]
这是因为 ClaudePlaysPokemon 是对大语言模型能力更纯粹的测试,这得益于其一贯简洁的 AI 智能体框架[2]以及其创建者、来自 Anthropic 的 David Hershey 相对无为而治的方式[3]。当 Claude 一次次在火箭队基地和菘菜道馆这样的"硬骨头"面前碰壁、持续数月无法突破时,没有做出任何实质性的努力来帮助 Claude 突破困境。
但 Claude Opus 4.5 终于突破了这些瓶颈,这在某种程度上验证了有关 Opus 4.5 是一个实质性进步的说法。
不过这远非 AGI 的先兆,正如后文所述。接下来是我的一位朋友的笔记。他在过去一年中观看了大量 ClaudePlaysPokemon 的内容,分析了 Claude 在 Opus 4.5 中如何改进(或未能改进)。[4]
今年早些时候,大语言模型在玩《精灵宝可梦》时基本上是"瞎子",无法一致地识别和区分门、建筑、树木、NPC 或障碍物。
例如,这个画面:
…在 Sonnet 3.7 时期,迷惑了我测试的所有大语言模型。它们都难以一致地识别精灵球的位置,或判断想要哪只精灵,有时甚至意外选择了错误的初始精灵。Opus 4.5 让这看起来成了小菜一碟。[5]
总体来说,Opus 4.5 不再难以找到门,并能在道馆、精灵中心和商店等关键建筑物出现在屏幕上时立即识别它们。此外,它对关键 NPC 的混淆明显减少了——大木博士始终是大木博士,玩家角色从不被叫作"戴红帽的 NPC",它能从人群中识别出馆主艘菜。
不过,新的视觉能力远非完美,其有效性取决于 Claude 是否真的在"看向"某处,以及 Claude 是否愿意相信自己看到的东西。
在第一点上,Claude 经常似乎会忽视他视野中的东西,如果他没有专注"看向"那里的话。更糟的是,在接近当前目标的关键时刻,他似乎更少依赖视觉,有时甚至完全忽视视觉。
上面是 Claude"失明"的典型例子。他左边的两个左指向箭头("转轮")代表唯一可能的进展路径,但他知道目标在右边,甚至认为他看到了。Claude 去过这个确切位置数十次,但少于 5 次意识到他左边有转轮。此外,他显然难以区分绿色箱子和转轮,经常试图踩在箱子上——一个只在接近目标时才显露的错误。在其他大多数时候,他似乎没有区分它们的问题。
这是另一个例子,会让 Twitch 观众感到痛苦:
这里,必须砍伐才能进入道馆的树木清晰可见,但 Claude 专注于寻找开放的通道,没有看到它的迹象,直接走了过去——但几分钟后,他会在返回时发现它,因为他已经放弃寻找开放的通道。[6]
在第二点上,如果 Claude 真的很想找到某样东西,他就会明显更容易产生幻觉或将物体误认为他要找的东西。
这里的典型例子是 Claude 在火箭队基地中寻找电梯:
已经过了几小时,Claude 变得有些绝望。这也不是他第一次幻想电梯。例如,在我们之前讨论的完全相同的位置,其实离电梯很近:
现在,电梯确实在那个方向,Claude 甚至之前(真的)看到过它。但他对此如此执着,以至于他将灰色墙壁误认为电梯,尽管他真的知道得更好。
在你对 Claude 过于严厉之前,他正在寻找的电梯看起来是这样的:
让我明确一点:我使用的是关于意向性的语言,好像 Claude 在选择忽视事物。我不认为是这样。我认为他的注意力机制主动过滤掉它们认为无关的内容,使得模型中试图做决策的部分对其有效地"失明"。
人类有内置的注意力机制,但显然构建得比这更好,尽管在极端情况下它们也有类似的失败模式。
我不想过度夸大这一点。Claude 对如何在 2D 世界中导航的理解明显仍低于大多数儿童的水平,但确实有改进:
当试图到达建筑物前面的门,但发现从某个方向被阻挡时,Claude 现在会尝试从另一个方向绕过去。
Claude 现在可以保持对建筑物或城市中哪些部分相互关联的认识(通过笔记),并执行简单的导航任务。以前的版本经常丢失不在视图中的东西的记录。
以前的版本经常丢失不在视图中的东西的记录。
Claude 现在可以进行一些基本的内外几何推理:从房间顶部离开建筑物可能会将我推出建筑物顶部、不同楼层的电梯可能在楼层上的相同位置,等等。
Claude 能力的另一个明显改进是笔记保存和上下文记忆的提升。以前的 Claude 版本(如 Sonnet 3.7)很少表现出它们"回想"最近几条消息以外的内容,尽管上下文中有大量相关信息。虽然它们是勤奋的笔记记录者,但它们很少似乎会读自己的笔记——当它们确实读时,显然是以随机的方式进行,以至于用户经常推测 Claude 这次是否会读他的笔记以及他会读笔记的哪一部分。
Opus 4.5 在监控上下文和使用笔记方面都好得多,好到大多数时候它都能成功地维持一种"真的记住"过去 15 分钟左右的假象,引用最近的事件,躲避过去的障碍,并总体保持更连贯的叙述。
对于长期记忆,Claude 必然依赖他碰巧在笔记中写下的任何内容,而他在编写和阅读自己的指令方面做得好得多,能够例行地成功和得心应手地重复过去的导航任务。如今,如果 Claude 做了某件事并写下了如何做,他就能再做一遍。
很难过度强调这对流畅、快速游戏流程的贡献。Claude 可以在长时间内保持导航焦点,能干地探索简单区域,只要笔记完善、假设合理,事情就会顺利进行。
当然,有时事情会出问题……
……但比以前更多的是,事情会迅速得到解决。这很难量化,我认为这在很大程度上源于更好的能力来注意何时事件在他的上下文窗口内重复。Claude 更频繁、更持续地注意到他在尝试明显不起作用的东西,并会尝试改变策略。结合他改进的空间推理,以前需要数天或数周试错的导航任务几乎轻而易举地完成了:常青森林和月见山相对简单,只需在常磐市周围循环几次就能直接到达码头,等等。
但并非全是好消息:Claude 仍然比人类慢得多,并非每个谜题都能轻松解决。Claude 也没有推断出"走到训练师面前会触发战斗"这样的关键事实,而是将这些视为有效的随机遭遇。
但这已经有所进步。
我想讲一个简短的故事,让读者了解有时观看 Claude 的感受,即使他在技术上很出色地完成了他的目标。这是 Claude 尝试获得火箭队总部电梯钥匙的故事,技术上是他做的第一件以前的模型从未完成的事情。
Claude 到达火箭队总部,立即将他身旁的楼梯宣称为通往坂木的电梯,他需要电梯钥匙来使用它。
Claude 随后忽视了这个假"电梯"数小时,确信他将无法"使用"它,在楼层的其余部分到处寻找电梯钥匙或另一组楼梯。
最后,他决定试试最初的“电梯”,并惊讶地发现它居然能用。他在笔记中写道,这部电梯不需要 Lift Key。
Claude 向下走了两层,遇到了臭名昭著的 B3F 迷宫。被困住后,他用掉了唯一的一根 Escape Rope,随后马上返回,并出乎所有人意料地一次就解开了迷宫,还把解法记了下来。
穿过迷宫来到 B4F 后,他清理了这片区域,却困惑地没能找到 Giovanni。他击败了携带 Lift Key 的 Team Rocket Grunt,却没有再次与对方交谈,因此没有拿到 Lift Key。(公平地说,这确实是游戏中一个非常令人困惑的细节,也曾难倒过许多孩子,GameFreak 后来在 Pokémon Yellow 中修改了这一设计。)
他断定自己之前搞错了,需要回到先前在 B1F 看到的那部“电梯”并使用它。
他沮丧地围着电梯转圈,试图“使用”它,随后断定自己缺少 Lift Key,于是返回 B3F,借助笔记轻松解开迷宫,并取得了 Lift Key。
接着他又回到了那部“电梯”。他围着电梯转了约 50 分钟,最后终于断定这不是真正的电梯,而是一种神秘地只连接两个楼层的“电梯/楼梯”。最终,他将其修正为“自动扶梯”,这似乎化解了认知失调;在 Team Rocket Hideout 剩余的探索时间里,他一直愉快地称它为自动扶梯。
早期,在进入 Team Rocket Hideout 之前,Claude Plays Pokemon 的观众确实一度怀疑,Anthropic 是否已经解决了 Claude 在这款游戏中的所有主要问题,也许接下来会一路顺风。他毫不费力地克服了早期模型最耗时间的几个难点——Mt. Moon、Viridian Forest、寻找从 Cerulean City 前往 Vermillion City 的道路,以及找到 S.S. Anne 的 Captain。
但关键在于,Claude 当时还没有遇到那些曾让先前模型永久停滞、无法继续推进的障碍。
到达 Ericka's Gym(就是我之前提到的、门口有棵可以用 CUT 砍掉的树的那个 Gym)后,Claude 花了约 4 天,也就是大约 8000 个推理步骤,围着 Gym 顶部单调地转圈,寻找一条可以通过的路。
他究竟在做什么?基本上,他一直在尝试穿过无法通行的墙壁;而且因为知道进入 Gym 的过程多少与 CUT 有关,他还试图把 Gym 的屋顶砍开。
如果说 Claude 有什么特别突出的品质,那就是非人的耐心,[7] 但最终连他也放弃了,决定先去完成 Team Rocket Hideout——游戏规则确实允许玩家这样做。
又经过 13,000 多个推理步骤,[8] 在完成 Team Rocket Hideout 和其他任务后,Claude 返回此处,几乎立刻就找到了那棵真正可以用 CUT 砍掉的树,终于继续推进了游戏。[9]
有时候,你只是需要清醒一下头脑。
我认为,上面的轶事已经充分说明了糟糕的视觉能力、认知偏差和不一致的记忆仍会给 Claude Opus 4.5 带来哪些问题。但我尤其想强调,Claude 对笔记质量的依赖程度高得惊人:一条写进笔记的错误假设或幻觉,就可能让进度停滞数日;而一条写得好的笔记,则能让它表现出近似人类的能力。
我会将其类比为一个患有顺行性遗忘症的人:他无法形成新的记忆,只能不断写笔记来记录自己的人生。这里的局限显而易见,而且除非能用更好的方式解决 LLM 的记忆或持续学习问题,否则未来的 Claude 很可能仍会面临同样的限制。
从 Claude 的行为中,还能发现其他推理问题或非人类的思维方式,不过它们不像前面那些问题那样致命。
Claude 对短期目标的执着程度高得惊人,而且似乎从来没有兴趣尝试同时做两件事,哪怕这样做是为了服务更大的目标。它似乎也很少反思某项行动的长期后果,即使是极其简单的情况也不例外。
Claude 做过的一些事情,对人类玩家来说会非常反常:
在前方显然还有许多 Trainer 的情况下,反复使用 PP 有限的宝贵招式,却不考虑当前战斗是否可以使用其他招式解决(例如用 Ember 击败草系 Pokémon,从而节省 Slash 的 PP)。
背包空间不足时,Claude 经常直接丢弃贵重物品,哪怕它完全可以先使用其中一些物品。有时,它丢掉的物品甚至可以当场使用(例如可以喂给 Charizard、提升属性的 vitamin)。
面对水系 Pokémon 时,仍让 Charizard 留在场上,尽管替补席上的草系 Pokémon 可以轻松应对,结果白白浪费 PP。事实上,他就是特别喜欢只用 Charizard。这种策略以“孩子气”而臭名昭著,似乎能说明 Claude 的认知发展水平……也可能说明不了什么,因为 Red 足够简单,只使用 Charizard 本来就是主流速通策略之一。不过,Claude 从未声称自己在遵循任何这种策略。
这种策略以“孩子气”而臭名昭著,似乎能说明 Claude 的认知发展水平……也可能说明不了什么,因为 Red 足够简单,只使用 Charizard 本来就是主流速通策略之一。不过,Claude 从未声称自己在遵循任何这种策略。
在 Pokémon Tower 中,一个 rare candy 道具挡住了他的路,但他一个多小时都没有把它捡起来,因为他过于专注于寻找道路。总体而言,Claude 对捡拾道具有一种奇怪的抗拒。
总体而言,Claude 对捡拾道具有一种奇怪的抗拒。
就在最近,GPT-5.1 使用一个相当精简的运行框架完成了 Pokémon Crystal,整个过程用了 9,454 个推理步骤,现实时间为 108 小时。作为对比,最初的 Gemini 2.5 Pro Pokémon Blue 流程用了 106,505 个推理步骤,现实时间为 813 小时;而 Claude Opus 4.5 已经使用了 48,854 个推理步骤,耗时超过 300 小时。GPT-5.1 完成 Crystal 所用的 108 小时,只比人类玩家慢约 3 倍!只要给前沿 LLM 一张可靠的小地图和一些不错的提示词,[10] 如今它们玩 Pokémon 已经相当不错了。
Claude 始终使用的精简运行框架,向我们揭示了 LLM 认知能力的进步;但我们也不应忘记,过去一年中 Pokémon 智能体运行框架在效率上的提升同样说明了一些问题:原始智能并不是推动 LLM 性能进步的唯一杠杆。事实上,目前它甚至未必是最有效的杠杆。
^也就是说,Claude Sonnet 4、Claude Opus 4、Claude Opus 4.1 和 Claude Sonnet 4.5 都没能取得改善。至少从剧情推进的角度来看是这样;它们确实能更快抵达那个最终会被卡住的相同剧情节点。
也就是说,Claude Sonnet 4、Claude Opus 4、Claude Opus 4.1 和 Claude Sonnet 4.5 都没能取得改善。至少从剧情推进的角度来看是这样;它们确实能更快抵达那个最终会被卡住的相同剧情节点。
^确实有过一些改动:增加了对 Surf 的支持(因为 Claude 现在能推进到那么远了),移除了一批针对性的提示词,并将迷宫中的旋转地砖标记为类似障碍物的元素;还有一项相关改动,即等待玩家角色停止旋转后,再截取当前游戏状态的屏幕截图。尤其是后两项改动,让 Team Rocket Hideout 比之前几次流程更容易,但并没有让它变得毫无难度。更多细节请参阅这份文档。
确实有过一些改动:增加了对 Surf 的支持(因为 Claude 现在能推进到那么远了),移除了一批针对性的提示词,并将迷宫中的旋转地砖标记为类似障碍物的元素;还有一项相关改动,即等待玩家角色停止旋转后,再截取当前游戏状态的屏幕截图。尤其是后两项改动,让 Team Rocket Hideout 比之前几次流程更容易,但并没有让它变得毫无难度。更多细节请参阅这份文档。
^如需进一步了解 Pokémon 智能体运行框架,请参阅之前的这篇 LW 帖子。但简而言之,运行框架做了大量工作,让 LLM 能够理解游戏,并使用多种技术来解决所有 LLM 普遍存在的智能体能力弱点。尽管这些运行框架看起来可能相当简单,而且其中的工具也可以(并且确实曾经)由使用它们的 LLM 编写,但能够通关游戏的运行框架,同样经过了人类持续不断的试错优化,以便提供恰到好处的支持,克服当前 LLM 的局限。
如需进一步了解 Pokémon 智能体运行框架,请参阅之前的这篇 LW 帖子。但简而言之,运行框架做了大量工作,让 LLM 能够理解游戏,并使用多种技术来解决所有 LLM 普遍存在的智能体能力弱点。尽管这些运行框架看起来可能相当简单,而且其中的工具也可以(并且确实曾经)由使用它们的 LLM 编写,但能够通关游戏的运行框架,同样经过了人类持续不断的试错优化,以便提供恰到好处的支持,克服当前 LLM 的局限。
^其中有一些由我编辑的内容。
其中有一些由我编辑的内容。
^现代 Gemini/GPT 模型现在也能应对这种情况。
如今的 Gemini/GPT 模型也能处理这个问题了。
^这或许可以视为一种无意视盲,经典案例是篮球比赛中有个穿着大猩猩服装的人从场上走过。
这或许可以视为一种无意视盲,经典案例是篮球比赛中有个穿着大猩猩服装的人从场上走过。
^他无法真正记住足够多的经历,因而不会感到无聊,这一点可能确实有所帮助。不过,在后人类时代,我们或许也都会这么做,只是时间尺度更长。
他无法真正记住足够多的经历,因而不会感到无聊,这一点可能确实有所帮助。不过,在后人类时代,我们或许也都会这么做,只是时间尺度更长。
^其中 9000 次都耗在那个向左箭头旋转器的问题上了。
其中 9000 次都耗在那个向左箭头旋转器的问题上了。
^严格来说,Claude 还是花了几个小时才注意到道馆里那些可以用 CUT 砍掉、挡住通往道馆馆主 Erika 路径的树,但它最终还是发现了。
严格来说,Claude 还是花了几个小时才注意到道馆里那些可以用 CUT 砍掉、挡住通往道馆馆主 Erika 路径的树,但它最终还是发现了。
^小地图只有在 LLM 探索时才会逐渐补全。良好的提示能确保 LLM 基本上把探索一切作为首要任务,这意味着在实践中,LLM 始终都能掌握一份它可以理解的、质量不错的区域地图。这绕过了许多视觉和空间推理方面的弱点。其他关键工具还包括由 LLM 推理驱动的导航器,以及在地图上放置标记的能力。
小地图只有在 LLM 探索时才会逐渐补全。良好的提示能确保 LLM 基本上把探索一切作为首要任务,这意味着在实践中,LLM 始终都能掌握一份它可以理解的、质量不错的区域地图。这绕过了许多视觉和空间推理方面的弱点。其他关键工具还包括由 LLM 推理驱动的导航器,以及在地图上放置标记的能力。
我会把它类比为一个患有顺行性遗忘症的人:他无法形成新的记忆,只能不断写笔记来追踪自己的生活。这里的局限显而易见;除非能以更好的方式解决 LLM 记忆/持续学习问题,否则未来的 Claude 很可能也会面临这些局限。
说实话,这是一个被严重低估的类比。事实上,我认为「权重冻结 + 缺乏长期记忆」显然是 LLM 在许多任务上给人的印象远胜于实际用途的最大原因之一(可靠性则是另一个重大且独立的问题)。
这个类比强调了两个同时成立的事实:LLM 确实像人类一样进行推理,也可以拥有(质量较差的)世界模型;LLM 的能力与人类能力之间并不存在一道无法通过无限资源/时间来跨越的根本鸿沟。然而,正如患有顺行性遗忘症的人通常远不如拥有长期记忆的人那样适合就业/对他人有用,当前的 AI 也远远不如未来范式下的 AI 那样适合就业/有用。
我很好奇 LLM 玩《Slay the Spire》的表现会有多好。实际上,我可以手动试一下,看看会发生什么。
Neuro-sama(基于 LLM 的 AI VTuber)前段时间已经通关了这款游戏。不过,由于代码没有开源,所以无法确认它的《Slay the Spire》AI 是否是用 LLM 实现的。看看前沿 LLM 的表现肯定会非常有趣!
哦。感兴趣的人可以看这个链接。
Claude 第一次尝试时使用 Ironclad 挑战 Ascension 1,最后死在了第一幕 Boss Hexaghost 手里。表现不算糟糕,但偶尔会对游戏机制产生一点混淆。
这是聊天记录的链接。
感谢你真的去尝试并反馈了结果。
如果将来有人想制作一套正规的测试框架,我认为最有趣的问题或许是:LLM 能否从多次游戏过程中学习,解锁更高难度,等等。
现代 LLM 或许可以通过记笔记做到?
有趣的是,它在多大程度上依赖训练数据中已经存在的信息,以及查找资料的能力。我很好奇,如果让它「盲玩」一款此前根本不存在的游戏,它会表现得怎样。
这个基准测试中包含一个《Slay the Spire》环境!编写该基准时,Gemini 2.5 的表现最好,在无 Ascension 的游戏中大约推进到了一半。
我很想看看这次的结果 :)
Claude 第一次尝试时使用 Ironclad 挑战 Ascension 1,最后死在了第一幕 Boss Hexaghost 手里。表现不算糟糕,但偶尔会对游戏机制产生一点混淆。
这是聊天记录的链接。
观看 Claude 玩游戏时,有一点让我觉得非常有意思:它不会像我预期中的人类那样四处尝试和实验?它会站在原地,仍然试图弄清楚下一步该做什么;向上移动一格,思考很长时间,再向下移动一格,然后不断重复。而我会预期人类立刻感到无聊,尽可能朝各个方向走到尽头,看看那里有什么,并尝试与所有东西互动。也许某种认知层面与无聊类似的机制,有助于避免陷入循环?
这确实是这些模型的缺陷之一,也是那种会让你忍不住想对着屏幕冲它大喊的事情。比如,它花了好几天寻找一个入口,却只向右走了不到 20 格,而入口其实就在右侧 30 格处。又或者,它没有探索房间左下角——答案明明就在那里——因为它确信目标不可能在那里。
再比如,它已经在 Silph co 待到第二周了,原因是它确信自己寻找的东西不是地上的道具,因此即使从道具旁边经过也不会把它们捡起来,而事实上它的目标就是地上的一个道具。
已精选。我很欣赏这篇文章的具体性。
真正理解基准测试中的数字意味着什么,可能很困难。为此,你必须相当熟悉任务分布,而任务分布往往会有些出人意料。而且,如果你愿意花时间去熟悉它,可能早就已经知道 LLM 的表现如何了。因此,你很难确定自己是在准确判断任务难度,还是在利用自己对 LLM 智力水平的感受反推任务难度。
幸运的是,Pokémon 游戏涉及