Google发布新代旗舰模型,专为智能体应用优化,将直接改变开发者的工具选择和能力边界
谷歌和 Alphabet CEO 桑达尔·皮查伊(Sundar Pichai)
谷歌 DeepMind CEO
谷歌 DeepMind CTO
谷歌 DeepMind 推出 Gemini 2.0,这是一个为"智能体时代"设计的新型 AI 模型。
Gemini 2.0 的能力比之前的版本更强,具有原生图像和音频输出以及工具使用功能。
Gemini 2.0 Flash 现已向开发者和信任的测试者提供,更广泛的推出计划在明年初进行。
谷歌正在探索用 Gemini 2.0 实现的智能体体验,包括 Project Astra、Project Mariner 和 Jules。
谷歌致力于负责任地构建 AI,将安全和保障作为关键优先事项。
谷歌及 Alphabet CEO 桑达尔·皮查伊的致辞:
信息是人类进步的核心。这就是为什么在过去 26 年多的时间里,我们一直专注于整理全球信息并使其易于访问和有用的使命。这也是为什么我们继续推进 AI 的前沿,以在每个输入端整理信息,通过任何输出方式使其可访问,从而能够真正为你所用。
这就是去年 12 月我们推出 Gemini 1.0 时的愿景。作为第一个从本质上设计为多模态的模型,Gemini 1.0 和 1.5 通过多模态能力和长上下文理解在文本、视频、图像、音频和代码中取得了重大进展,并能处理更多内容。
现在数百万开发者正在使用 Gemini 构建应用。它帮助我们重新想象了所有产品——包括拥有 20 亿用户的全部 7 个产品——并创建了新的产品。NotebookLM 是多模态和长上下文如何为人们带来强大能力的很好例子,也是为什么它受到这么多人喜爱的原因。
在过去的一年里,我们一直在投资开发更具智能体属性的模型,这意味着它们可以更好地理解周围的世界,提前多步思考,并在你的监督下为你采取行动。
今天我们很兴奋地推出为这个新的智能体时代构建的下一代模型:推出 Gemini 2.0,这是我们迄今为止最强大的模型。凭借多模态领域的新进展——如原生图像和音频输出——以及原生工具使用,它将使我们能够构建新的 AI 智能体,让我们更接近通用助手的愿景。
我们今天将 2.0 交给开发者和信任的测试者。我们正在快速行动,将其集成到我们的产品中,首先是 Gemini 和 Search。从今天开始,我们的 Gemini 2.0 Flash 实验版本将对所有 Gemini 用户可用。我们还推出了一项称为 Deep Research 的新功能,它使用高级推理和长上下文能力充当研究助手,探索复杂主题并代表你编制报告。它现在可在 Gemini Advanced 中使用,你可以在我们的网站上了解更多信息。
没有哪个产品的变革比 Search 更被 AI 改变。我们的 AI Overviews 现已覆盖 10 亿人,使他们能够提出全新类型的问题——迅速成为我们最受欢迎的 Search 功能之一。作为下一步,我们正在将 Gemini 2.0 的高级推理能力引入 AI Overviews,以处理更复杂的主题和多步骤问题,包括高等数学方程、多模态查询和编码。我们本周开始了有限测试,并将在明年初更广泛地推出。我们还将在明年期间继续为更多国家和语言提供 AI Overviews。
2.0 的进步得益于我们在 AI 创新全栈式方法上十年来的持续投资。它建立在像 Trillium(我们第六代 TPU)这样的定制硬件之上。TPU 为 Gemini 2.0 的 100% 训练和推理提供动力,今天 Trillium 已向客户正式提供,他们也可以用它来构建。
如果 Gemini 1.0 是关于组织和理解信息,那么 Gemini 2.0 是关于使信息更加有用。我迫不及待地想看看这个新时代会带来什么。——桑达尔
作者:谷歌 DeepMind CEO Demis Hassabis 和谷歌 DeepMind CTO Koray Kavukcuoglu,代表 Gemini 团队
在过去的一年里,我们在人工智能领域取得了难以置信的进步。今天,我们发布了 Gemini 2.0 系列模型中的第一个模型:Gemini 2.0 Flash 的实验版本。它是我们的主力模型,具有低延迟和增强的性能,代表我们技术在规模上的前沿水平。
我们还通过展示由 Gemini 2.0 的原生多模态能力驱动的原型,分享了我们智能体研究的前沿成果。
Gemini 2.0 Flash 基于 1.5 Flash 的成功而构建,1.5 Flash 是我们迄今为止对开发者最受欢迎的模型,具有增强的性能和同样快的响应时间。值得注意的是,2.0 Flash 甚至在关键基准上超越了 1.5 Pro,速度快了两倍。2.0 Flash 还配备了新功能。除了支持图像、视频和音频等多模态输入,2.0 Flash 现在还支持多模态输出,如原生生成的与文本混合的图像和可控的多语言文本转语音(TTS)音频。它还可以原生调用 Google Search、代码执行以及第三方用户定义函数等工具。
我们的目标是安全快速地将模型交给用户。在过去的一个月里,我们一直在分享 Gemini 2.0 的早期实验版本,获得了开发者的很好反馈。
Gemini 2.0 Flash 现在作为实验模型通过 Gemini API 向开发者提供,可在 Google AI Studio 和 Vertex AI 中访问。所有开发者都可以使用多模态输入和文本输出,文本转语音和原生图像生成可供早期进入的合作伙伴使用。正式推出将在 1 月份进行,同时还会推出更多模型规模版本。
为了帮助开发者构建动态和交互式应用,我们还发布了一个新的 Multimodal Live API,它具有实时音频、视频流输入以及使用多个组合工具的能力。有关 2.0 Flash 和 Multimodal Live API 的更多信息可以在我们的开发者博客中找到。
同样从今天开始,全球 Gemini 用户可以通过在桌面和移动网页上的模型下拉菜单中选择 2.0 Flash 实验版本来访问经过聊天优化的版本,它很快也将在 Gemini 移动应用中推出。通过这个新模型,用户可以体验到更有帮助的 Gemini 助手。
明年初,我们将把 Gemini 2.0 扩展到更多谷歌产品。
Gemini 2.0 Flash 的原生用户界面操作能力,加上其他改进如多模态推理、长上下文理解、复杂指令跟随和规划、组合函数调用、原生工具使用和改进的延迟,所有这些共同作用,使得一类新的智能体体验成为可能。
AI 智能体的实际应用是一个充满激动人心可能性的研究领域。我们通过一系列原型来探索这个新前沿,这些原型可以帮助人们完成任务和事项。这些包括对 Project Astra 的更新,我们的研究原型,探索通用 AI 助手的未来能力;新的 Project Mariner,它探索人类与智能体交互的未来,从你的浏览器开始;以及 Jules,一个可以帮助开发者的由 AI 驱动的代码智能体。
我们仍然处于开发的早期阶段,但我们很兴奋看到信任的测试者如何使用这些新功能以及我们能学到什么经验,这样我们可以在未来在产品中更广泛地使用它们。
自我们在 I/O 大会推出 Project Astra 以来,我们一直在从在 Android 手机上使用它的信任的测试者那里学习。他们的宝贵反馈帮助我们更好地理解通用 AI 助手在实践中如何运作,包括对安全和伦理的影响。用 Gemini 2.0 构建的最新版本的改进包括:
更好的对话:Project Astra 现在具有用多种语言和混合语言进行对话的能力,对口音和不寻常单词有更好的理解。
新的工具使用:通过 Gemini 2.0,Project Astra 可以使用 Google Search、Lens 和 Maps,使其在你的日常生活中更有用。
更好的记忆:我们改进了 Project Astra 记住事物的能力,同时让你保持控制。它现在有长达 10 分钟的会话内记忆,可以记住更多过去与它的对话,因此对你来说个性化程度更高。
改进的延迟:通过新的流式传输能力和原生音频理解,该智能体可以以大约人类对话的延迟来理解语言。
我们正在努力将这些类型的能力带到 Gemini 应用等谷歌产品以及眼镜等其他形式因素。我们还在开始扩展我们的信任的测试者计划到更多人群,包括一个小的团体将很快开始在原型眼镜上测试 Project Astra。
Project Mariner 是用 Gemini 2.0 构建的早期研究原型,它探索人类与智能体交互的未来,从你的浏览器开始。作为研究原型,它能够理解和推理你浏览器屏幕上的信息,包括像素和网页元素如文本、代码、图像和表单,然后通过实验性 Chrome 扩展使用这些信息为你完成任务。
在针对 WebVoyager 基准的评估中(该基准测试端到端真实世界网页任务中的智能体性能),Project Mariner 作为单个智能体设置取得了 83.5% 的最先进结果。
虽然还很早期,但 Project Mariner 表明在浏览器内进行导航在技术上变成了可能的事情,尽管今天要完成任务还不总是准确和缓慢,但这将随着时间推移迅速改进。
为了安全负责任地构建此功能,我们正在进行关于新型风险和缓解措施的积极研究,同时将人类留在循环中。例如,Project Mariner 只能在浏览器的活动标签页中输入、滚动或点击,并在采取某些敏感操作(如购买某物)之前要求用户最终确认。
信任的测试者现在正在使用实验性 Chrome 扩展开始测试 Project Mariner,我们也在与网络生态系统开始并行对话。
接下来,我们正在探索 AI 智能体如何通过 Jules 协助开发者——一个直接集成到 GitHub 工作流中的实验性 AI 驱动代码智能体。它可以处理一个问题,制定计划并执行它,所有这一切都在开发者的指导和监督下进行。这项工作是我们构建有益于所有领域(包括编码)的 AI 智能体的长期目标的一部分。
有关这项正在进行的实验的更多信息可以在我们的开发者博客文章中找到。
谷歌 DeepMind 拥有悠久的历史,利用游戏来帮助 AI 模型更好地遵循规则、规划和逻辑。例如,就在上周,我们推出了 Genie 2,我们的 AI 模型,可以从单张图像创建无穷多样的可玩 3D 世界。在这一传统的基础上,我们构建了使用 Gemini 2.0 的智能体,可以帮助你在视频游戏的虚拟世界中进行导航。它可以仅基于屏幕上的动作来推理游戏,并在实时对话中提供关于接下来该做什么的建议。
我们与像 Supercell 这样的领先游戏开发商合作,探索这些智能体如何运作,测试他们在解释从像"部落冲突"这样的战略类游戏到像"干草日"这样的农业模拟游戏等各种游戏的规则和挑战的能力。
除了充当虚拟游戏伙伴,这些智能体甚至可以利用 Google Search 为你连接网络上丰富的游戏知识。
除了在虚拟世界探索智能体能力,我们还在进行实验,研究可以通过将 Gemini 2.0 的空间推理能力应用于机器人学来在物理世界中提供帮助的智能体。虽然还很早期,但我们对可以在物理环境中提供协助的智能体的潜力感到兴奋。
你可以在 labs.google 了解更多关于这些研究原型和实验的信息。
Gemini 2.0 Flash 和我们的研究原型允许我们测试和迭代 AI 研究前沿的新能力,这最终将使谷歌产品更加有帮助。
在我们开发这些新技术的同时,我们认识到它带来的责任,以及 AI 智能体为安全和保障开放的众多问题。这就是为什么我们采用探索性和渐进式的方法来开发,对多个原型进行研究,迭代实施安全训练,与信任的测试者和外部专家合作,并进行广泛的风险评估以及安全和保障评估。
作为我们安全流程的一部分,我们与 Responsibility and Safety Committee(RSC)(我们长期存在的内部审查小组)合作,来识别和理解潜在风险。
Gemini 2.0 的推理能力在我们的 AI 辅助红队策略方面实现了重大进步,包括超越简单检测风险,现在自动生成评估和训练数据来缓解风险的能力。这意味着我们可以更有效地在规模上优化模型的安全性。
随着 Gemini 2.0 的多模态性增加了潜在输出的复杂性,我们将继续在图像和音频输入输出上评估和训练模型,以帮助改进安全性。
通过 Project Astra,我们在探索对用户无意中与智能体共享敏感信息的潜在缓解,我们已经内置了隐私控制,使用户可以轻松删除会话。我们还在继续研究确保 AI 智能体充当可靠信息来源的方法,并且不会代表你采取无意的行动。
通过 Project Mariner,我们正在确保模型学会优先考虑用户指令而不是第三方提示注入尝试,这样它可以识别来自外部来源的潜在恶意指令并防止滥用。这防止用户通过隐藏在电子邮件、文档或网站中的恶意指令而暴露于欺诈和网络钓鱼企图。
我们坚信构建 AI 的唯一方法就是从一开始就负责任地构建,我们将继续优先将安全和责任作为我们模型开发流程的关键要素,因为我们推进我们的模型和智能体。
今天的发布标志着我们 Gemini 模型的新篇章。通过发布 Gemini 2.0 Flash 和一系列探索智能体可能性的研究原型,我们已经在 Gemini 时代达到了令人兴奋的里程碑。我们期待继续安全地探索我们能够到达的所有新可能性,同时为 AGI 的构建而努力。