DeepMind推出通用AI Agent,在复杂3D虚拟环境中展现多任务泛化能力。对游戏开发和虚拟环境应用有重要启发意义。
我们介绍了一项关于可扩展可指导多世界 Agent(SIMA)的新研究,它能够遵循自然语言指令在各种视频游戏环境中完成任务。
视频游戏是人工智能(AI)系统的重要测试平台。与现实世界一样,游戏是丰富的学习环境,具有反应灵敏的实时设置和不断变化的目标。
从我们早期对 Atari 游戏的研究,到我们的 AlphaStar 系统以宗师级水平玩 StarCraft II,Google DeepMind 在 AI 和游戏领域有悠久的历史。
今天,我们宣布了一个新的里程碑——将焦点从单个游戏转向一个通用的、可指导的游戏 AI agent。
在一份新的技术报告中,我们介绍了 SIMA(可扩展可指导多世界 Agent 的简称),一个用于 3D 虚拟环境的通用 AI agent。我们与游戏开发商合作,在各种视频游戏上训练 SIMA。这项研究标志着首次有 agent 能够理解广泛的游戏世界,并遵循自然语言指令在其中完成任务,就像人类一样。
这项工作的目标不是获得高游戏分数。对 AI 系统来说,学会玩甚至一款视频游戏都是技术壮举,但学会在各种游戏环境中遵循指令可能会为任何环境解锁更有帮助的 AI agent。我们的研究表明了如何通过语言界面将高级 AI 模型的能力转化为有用的现实行动。我们希望 SIMA 和其他 agent 研究能够将视频游戏作为沙箱,以便更好地理解 AI 系统如何变得更有帮助。
为了让 SIMA 接触许多环境,我们与游戏开发商建立了多项研究合作关系。我们与八个游戏工作室合作,在九款不同的视频游戏上训练和测试 SIMA,例如 Hello Games 的《无人深空》和 Tuxedo Labs 的《拆迁模拟器》。SIMA 作品集中的每款游戏都打开了一个新的交互世界,包括一系列要学习的技能,从简单的导航和菜单使用,到采矿资源、驾驶飞船或制作头盔。
我们还使用了四个研究环境——包括一个我们用 Unity 建立的新环境,称为建筑实验室,其中 agent 需要从建筑块中构建雕塑,这些测试了它们的物体操作和对物理世界的直观理解。
通过从不同的游戏世界中学习,SIMA 捕捉了语言与游戏行为的联系。我们最初的方法是在我们作品集中的游戏中记录人类玩家的配对,其中一个玩家观看并指导另一个玩家。我们还让玩家自由玩耍,然后重新观看他们的操作并记录会导致其游戏行为的指令。
SIMA 是一个能够感知和理解各种环境,然后采取行动实现指定目标的 AI agent。它包含一个为精确图像语言映射而设计的模型和一个预测屏幕上接下来会发生什么的视频模型。我们在特定于 SIMA 作品集中 3D 设置的训练数据上微调了这些模型。
我们的 AI agent 不需要访问游戏的源代码,也不需要定制 API。它只需要两个输入:屏幕上的图像和用户提供的简单自然语言指令。SIMA 使用键盘和鼠标输出来控制游戏的中心角色以执行这些指令。这个简单的界面是人类使用的,这意味着 SIMA 可能能够与任何虚拟环境交互。
当前版本的 SIMA 在 600 个基本技能上进行评估,涵盖导航(例如"向左转")、物体交互("爬梯子")和菜单使用("打开地图")。我们已经训练 SIMA 完成可在约 10 秒内完成的简单任务。
我们希望我们未来的 agent 能够处理需要高级战略规划和多个子任务才能完成的任务,例如"寻找资源并建立营地"。这对 AI 总体来说是一个重要目标,因为虽然大语言模型已经产生了能够捕捉关于世界知识和生成计划的强大系统,但它们目前缺乏代表我们采取行动的能力。
我们展示了在许多游戏上训练的 agent 优于仅学会玩一款游戏的 agent。在我们的评估中,在我们作品集中的九款 3D 游戏集合上训练的 SIMA agent 显著优于所有仅在每个游戏上训练的专业 agent。更重要的是,在除一款游戏外的所有游戏上训练的 agent 在该未见游戏上的性能平均而言几乎与专门为其训练的 agent 一样好。重要的是,这种在全新环境中发挥作用的能力突出了 SIMA 超越其训练泛化的能力。这是一个有前景的初步结果,但 SIMA 要在已见和未见的游戏中都达到人类水平需要更多研究。
我们的结果还表明 SIMA 的性能依赖于语言。在一个对照测试中,agent 没有获得任何语言训练或指令,它表现得适当但漫无目的。例如,agent 可能会收集资源,这是一种频繁的行为,而不是走到它被指示去的地方。
SIMA 的结果显示了开发新一波通用的、语言驱动的 AI agent 的潜力。这是早期阶段的研究,我们期待进一步在 SIMA 上进行建设,涵盖更多训练环境并融合更强大的模型。
随着我们让 SIMA 暴露在更多训练世界中,我们期望它变得更具泛化性和多功能性。通过更高级的模型,我们希望改进 SIMA 对高级语言指令的理解和行动能力,以实现更复杂的目标。
最终,我们的研究致力于构建更通用的 AI 系统和 agent,它们能够以对人们在线和现实世界中有帮助的方式理解并安全地执行广泛的任务。
我们要感谢所有论文作者:Maria Abi Raad, Arun Ahuja, Catarina Barros, Frederic Besse, Andrew Bolt, Adrian Bolton, Bethanie Brownfield, Gavin Buttimore, Max Cant, Sarah Chakera, Stephanie Chan, Jeff Clune, Adrian Collister, Vikki Copeman, Alex Cullum, Ishita Dasgupta, Julia Di Trapani, Yani Donchev, Martin Engelcke, Ryan Faulkner, Frankie Garcia, Charles Gbadamosi, Zhitao Gong, Lucy Gonzales, Karol Gregor, Kshitij Gupta, Arne Olav Hallingstad, Tim Harley, Sam Haves, Felix Hill, Ed Hirst, Drew Hudson, Jony Hudson, Steph Hughes-Fitt, Danilo J. Rezende, Mimi Jasarevic, Laura Kampis, Rosemary Ke, Thomas Keck, Junkyung Kim, Oscar Knagg, Kavya Kopparapu, Andrew Lampinen, Rory Lawton, Shane Legg, Alexander Lerchner, Marjorie Limont, Yulan Liu, Maria Loks-Thompson, Joseph Marino, Kathryn Martin Cussons, Loic Matthey, Siobhan Mcloughlin, Piermaria Mendolicchio, Hamza Merzic, Anna Mitenkova, Alexandre Moufarek, Valeria Oliveira, Yanko Oliveira, Hannah Openshaw, Renke Pan, Aneesh Pappu, Alex Platonov, Ollie Purkiss, David Reichert, John Reid, Pierre Harvey Richemond, Tyson Roberts, Giles Ruscoe, Jaume Sanchez Elias, Tasha Sandars, Daniel P. Sawyer, Tim Scholtes, Guy Simmons, Daniel Slater, Hubert Soyer, Heiko Strathmann, Peter Stys, Allison Tam, Tayfun Terzi, Davide Vercelli, Bojan Vujatovic, Marcus Wainwright, Jane X. Wang, Zhengdong Wang, Daan Wierstra, Duncan Williams, Nathaniel Wong, Sarah York and Nick Young.
特别感谢与我们合作的所有游戏开发商:Coffee Stain (Valheim, Satisfactory, Goat Simulator 3), Foulball Hangover (Hydroneer), Hello Games (No Man's Sky), Keen Software House (Space Engineers), RubberbandGames (Wobbly Life), Strange Loop Games (Eco) 和 Tuxedo Labs & Saber Interactive (Teardown)。
SIMA 2:在虚拟 3D 世界中与你一起玩耍、推理和学习的 Agent
在视频游戏世界中构建交互式 Agent
AlphaStar:使用多 agent 强化学习在 StarCraft II 中达到宗师级水平
通常能力强的 agent 从开放式玩耍中出现
使用 Unity 帮助解决智能问题
有效利用演示来解决困难的探索问题