Gemini 驱动的智能体能在交互式虚拟环境中理解语言、推理决策并执行动作,展示多模态 AI 的新能力边界。
去年,我们推出了 SIMA(可扩展可指导多世界 Agent),这是一款能够在广泛的虚拟环境中遵循基本指令的通用 AI。SIMA 是教会 AI 在丰富的 3D 世界中将语言转化为有意义行动的关键第一步。
今天,我们推出 SIMA 2,这是我们创建通用且有帮助的 AI Agent 研究中的下一个里程碑。通过集成 Gemini 模型的先进能力,SIMA 正在从一个指令跟随者演变为一个交互式游戏伙伴。SIMA 2 不仅能够在虚拟世界中遵循人类语言指令,它现在还能够思考自己的目标、与用户交谈,并随着时间的推移改进自己。
这是朝着通用人工智能(AGI)方向迈出的重要一步,对未来机器人技术和 AI 具身化的发展有重要影响。
SIMA 的第一个版本学会了执行超过 600 项语言跟随技能,如"向左转"、"爬梯子"和"打开地图",跨越各种商业视频游戏。它在这些环境中的操作方式就像一个人一样,通过"查看"屏幕并使用虚拟键盘和鼠标进行导航,而无法访问游戏的底层机制。
在 SIMA 2 中,我们已经超越了指令跟随。通过将 Gemini 模型嵌入作为 Agent 的核心,SIMA 2 不仅能够响应指令,还能够思考和推理。
SIMA 2 的新架构集成了 Gemini 强大的推理能力,帮助它理解用户的高级目标,在追求这些目标的过程中执行复杂的推理,并在游戏内熟练地执行面向目标的行动。
我们使用带有语言标签的人类演示视频以及 Gemini 生成的标签混合数据来训练 SIMA 2。因此,SIMA 2 现在可以向用户描述它打算做什么,并详细说明它为完成目标而采取的步骤。
在测试中,我们发现与 Agent 的交互感觉不像是给它下达命令,而更像是与一个可以推理当前任务的伙伴合作。
由于我们与现有和新的游戏合作伙伴的合作(见下文"致谢"部分),我们能够在更广泛的游戏上训练和评估 SIMA 2。
这就是 Gemini 在具身 AI 中的力量:一个世界级的推理引擎,现在可以在复杂的交互式 3D 环境中感知、理解和采取行动。
Gemini 的加入也带来了改进的泛化和可靠性。SIMA 2 现在能够理解比其前身更复杂和微妙的指令,并且在执行它们时成功率远高,特别是在它从未训练过的情况或游戏中,例如新的维京生存游戏 ASKA 或 MineDojo——流行的开放世界沙盒游戏 Minecraft 的研究实现。
SIMA 2 能够理解并完成长而复杂的任务
SIMA 2 理解多模态 prompt
SIMA 2 能够理解不同的语言,甚至表情符号
此外,它转移学习概念的能力——例如,将它在一款游戏中对"采矿"的理解应用到另一款游戏中的"收获"——是实现人类认知所表现出的那种广泛泛化的基础。实际上,由于这种能力,SIMA 2 在广泛任务范围内的表现与人类玩家的表现显著更接近。
为了测试 SIMA 2 泛化能力的极限,我们将其与另一个突破性研究项目 Genie 3 相结合,后者可以从单个图像或文本 prompt 生成新的实时 3D 模拟世界。
当我们挑战 SIMA 2 在这些新生成的世界中游玩时,我们发现它能够理智地定位自己、理解用户指令,并朝着目标采取有意义的行动,尽管它从未见过这样的环境。它展示了前所未有的适应性水平。
SIMA 2 最令人兴奋的新能力之一是其自我改进的能力。我们观察到,在整个训练过程中,SIMA 2 Agent 可以执行越来越复杂和新的任务,由试错和基于 Gemini 的反馈引导。
例如,在初始从人类演示中学习后,SIMA 2 可以过渡到仅通过自我指导的游玩在新游戏中学习,在之前未见过的世界中发展其技能,无需额外的人类生成的数据。在后续的训练中,SIMA 2 自己的体验数据可以用来训练下一个、甚至更强大的 Agent 版本。我们甚至能够在新创建的 Genie 环境中利用 SIMA 2 的自我改进能力——这是在多样化生成世界中训练通用 Agent 的重大里程碑。
这种迭代改进的良性循环为一个未来铺平了道路,在这个未来中,Agent 可以以最小的人类干预学习和成长,成为具身 AI 中的开放式学习者。
SIMA 2 在多样化游戏环境中运作的能力是通用智能的关键试验场,允许 Agent 掌握技能、实践复杂推理,并通过自我指导的游玩持续学习。
虽然 SIMA 2 是朝着通用的、交互的、具身的智能迈出的重要一步,但它从根本上是一项研究工作,其当前的局限性突出了未来工作的关键领域。我们发现 Agent 仍然面临很长期限、复杂任务的挑战,这些任务需要广泛的多步推理和目标验证。SIMA 2 也对其交互的记忆相对较短——它必须使用有限的上下文窗口来实现低延迟交互。最后,通过键盘和鼠标接口执行精确的低级别动作,以及实现对复杂 3D 场景的稳健视觉理解仍然是整个领域继续解决的开放挑战。
这项研究为面向行动 AI 的新路径提供了基础验证。SIMA 2 证实了一个为广泛能力训练的 AI,利用多样化的多世界数据和 Gemini 的强大推理,可以成功地将许多专门系统的能力统一为一个连贯的、通用 Agent。
SIMA 2 也为机器人学应用提供了强有力的路径。它学到的技能——从导航和工具使用到协作任务执行——是物理世界中未来 AI 助手所需的物理具身智能的一些基本构建块。
SIMA 2 是一个交互式的、以人为中心的 Agent,特别是以其解释自己推理方式的有趣方式来说,它很有趣。与我们所有的先进和基础技术一样,我们始终致力于从一开始就负责任地开发 SIMA 2。特别是在涉及其技术创新,特别是自我改进的能力时更是如此。
在构建 SIMA 2 时,我们与我们的负责任开发与创新团队合作。随着我们继续探索潜在应用,我们正在将 SIMA 2 宣布为有限研究预览,并向一小批学术界人士和游戏开发者提供早期访问。这种方法使我们能够在探索这个新领域时收集关键反馈和跨学科视角,并继续增进我们对风险及其适当缓解措施的理解。我们期待与社区进一步合作,以负责任的方式开发这项技术。
这项研究由 SIMA 2 团队开发:Maria Abi Raad、John Agapiou、Frederic Besse、Andrew Bolt、Sarah Chakera、Harris Chan、Jeff Clune、Alexandra Cordell、Martin Engelcke、Ryan Faulkner、Maxime Gazeau、Arne Olav Hallingstad、Tim Harley、Ed Hirst、Drew Hudson、Laura Kampis、Sheleem Kashem、Thomas Keck、Matija Kecman、Oscar Knagg、Alexander Lerchner、Bonnie Li、Yulan Liu、Cong Lu、Maria Loks-Thompson、Joseph Marino、Kay McKinney、Piermaria Mendolicchio、Anna Mitenkova、Alexandre Moufarek、Fabio Pardo、Ollie Purkiss、David Reichert、John Reid、Tyson Roberts、Daniel P. Sawyer、Tim Scholtes、Daniel Slater、Hubert Soyer、Kaustubh Sridhar、Peter Stys、Tayfun Terzi、Davide Vercelli、Bojan Vujatovic、Jane X. Wang、Luyu Wang、Duncan Williams 和 Lei M. Zhang。
感谢以下人士的领导、指导和支持:Satinder Singh Baveja、Adrian Bolton、Zoubin Ghahramani、Raia Hadsell、Demis Hassabis、Shane Legg、Volodymyr Mnih 和 Daan Wierstra。
特别感谢部分贡献者和过去的成员:Alex Cullum、Karol Gregor、Rosemary Ke、Junkyung Kim、Matthew Jackson、Andrew Lampinen、Loic Matthey、Hannah Openshaw 和 Zhengdong Wang。
特别感谢所有与我们合作的游戏开发者:Coffee Stain(Valheim、Satisfactory、Goat Simulator 3)、Foulball Hangover(Hydroneer)、Hello Games(No Man's Sky)、Keen Software House(Space Engineers)、RubberbandGames(Wobbly Life)、Strange Loop Games(Eco)、Thunderful Games(ASKA、The Gunk、Steamworld Build)、Digixart(Road 96)和 Tuxedo Labs & Saber Interactive(Teardown)。
我们感谢 Vika Koriakin、Duncan Smith、Nilesh Ray、Matt Miller、Leen Verburgh、Ashyana Kachra、Phil Esposito、Dimple Vijaykumar、Piers Wingfield 和 Lucie Kerley 在开发和完善该项目关键组件中的宝贵合作。
我们还感谢 Jack Parker-Holder、Shlomi Fruchter 和 Genie 团队的其他成员提供的 Genie 3 模型的访问权限。
我们想要认可来自谷歌和 Google DeepMind 许多团队的贡献,包括法律、营销、通信、责任和安全委员会、负责任开发和创新、政策、战略和运营以及我们的业务和企业发展团队。我们也想感谢所有未在此明确提及的 GDM 团队继续提供的支持。
最后,我们将这项工作献给我们的同事 Felix Hill 和 Fabio Pardo 的记忆,他们对我们领域的贡献继续激励着我们。