Nano Banana Pro:Google 新一代图像模型开发指南
Google 开放 Gemini 3 Pro 图像模型 API,提供完整的构建教程。对需要图像处理能力的开发者有实用价值。
Google 开放 Gemini 3 Pro 图像模型 API,提供完整的构建教程。对需要图像处理能力的开发者有实用价值。
开发者可以使用 Nano Banana Pro(Gemini 3 Pro Image)这一强大的新型图像生成与编辑模型,利用其高级功能和创意控制能力进行构建。
Google DeepMind 产品经理
Google DeepMind 产品经理
今天,我们正式发布 Nano Banana Pro(Gemini 3 Pro Image)。这是一个基于 Gemini 3 Pro 构建的高保真模型,让开发者能够获得工作室级别的图像生成能力。就在几个月前,我们发布了 Nano Banana(Gemini 2.5 Flash Image)。此后,我们很高兴看到社区将它的核心功能应用于各种场景——从保持角色一致性到修复照片,甚至利用其能力在无限画布中进行局部编辑。
这款先进的图像生成与编辑模型已开始以付费预览的形式逐步推出。开发者可以通过 Google AI Studio 中的 Gemini API 使用它,企业则可通过 Vertex AI 接入,从而构建新一代智能多模态应用。该模型能够生成高保真图像,在文字渲染准确性和世界知识方面都有显著提升;同时,它还可以借助 Google Search 进行 grounding,根据用户的 prompt 检索数据,进一步增强生成能力。
Gemini 3 Pro Image 在 Text to Image AI 基准测试中表现出色。
我们也在推动 Gemini 3 Pro Image 覆盖更广泛的开发者生态。在 Google Antigravity——我们全新的 Agent 开发平台——中,编码 Agent 现在可以直接利用这些图像生成能力:既可以生成详细的 UI mockup 供用户审阅,也可以在编写实现代码之前创建新的视觉素材。此外,包括 Adobe 和 Figma 在内的主流创意平台也正在集成该模型。
如果你正在构建需要高精度的高级工具,Gemini 3 Pro Image 可以让你控制图像中的物理表现,包括光照、相机、焦点和调色,以及画面构图,从而确保输出达到专业品质。
一道剪影迷失在金色散景与晨雾交织的海洋中。
Prompt: Replace volumetric lighting with bokeh
Gemini 3 Pro Image 支持 2K 和 4K 分辨率,可确保输出满足专业制作所需的分辨率标准。你可以轻松组合产品图片、Logo 和参考图等不同元素,创建风格统一的广告素材。模型最多可以保持五个人物的外貌一致,整合六张高保真图片,或将多达十四个标准输入融合为一张精致完整的广告图。你还可以试用我们的 demo app,将 Logo 与产品组合起来,创建自己的 mockup 设计。
这个 demo app 可以利用参考图片,让产品设计真正呈现出来。演示序列经过缩短。
与 2.5 Flash Image 相比,Gemini 3 Pro Image 实现了重大跃升,将抽象的图像生成转化为真正可用的功能性素材。它擅长处理逻辑与语言,并具备先进的文字渲染能力,可以生成清晰、准确且自然融入图像的文字。
富有创意的美食摄影:每个单词都使用与对应食物相关的真实食材,以艺术化方式拼写而成。
Prompt: Make 8 sophisticated minimalistic logos, each is a fun food word, and make letters from realistic food to express the meaning of this word. composition: a rendering of all logos on a single solid white background
它也是制作营销物料、教育内容以及众多其他应用的理想选择。你可以在 Google AI Studio 的漫画生成器 app 中体验该模型的能力:以你和朋友为主角,创作原创的多页漫画书,并使用高级文字渲染和风格化功能。
这个 demo app 可以根据照片和选定的题材,以你选择的语言创作漫画书。演示序列经过缩短。
借助 Gemini 3 Pro Image,我们消除了图像生成与本地化逻辑之间的障碍。这个高级模型能够理解图像的语义上下文,因此可以利用 image-to-image generation,轻松更改菜单、标牌或文档等元素中的语言,同时保留原有的艺术风格或版式。
一个饮料营销活动概念,展示了如何将英文文本准确翻译成法文并完成渲染。
Prompt: Translate to French
相比以往的图像生成模型,Gemini 3 Pro Image 能够连接庞大的知识库,生成事实准确性更高的素材。此外,启用相关功能后,借助 Google Search 的 grounding 可以将模型连接到实时 Web 内容,从而生成数据驱动的结果。对于需要精准呈现的应用,例如生物学图解或历史地图,这项能力尤其有价值。你可以通过我们的 demo app 亲自体验:针对任意主题,根据目标受众动态创建 infographic。
通过一个用于创建教育类 infographic 的 demo app 生成的自行车养护与维修 infographic。
这次发布的新模型吸收了许多你们此前向我们提供的反馈,但我们不会止步于此。为了确保 AI 生成媒体的来源清晰可追溯,我们已将 SynthID 数字水印直接集成到 Gemini 3 Pro Image 创建或编辑的每一张图像中,用于表明其由 AI 生成或经过 AI 编辑。
你可以先探索我们使用 Gemini 3 Pro Image 构建的一系列 app,激发灵感并了解它能实现哪些可能。获得灵感后,你可以 remix 这些 demo app,也可以通过 Google AI Studio 中的 Gemini API,将模型直接集成到自己的项目中;企业用户则可以通过 Vertex AI 使用。开发过程中如需了解技术细节,可以查阅文档、prompt 指南和 cookbook,或前往开发者论坛寻求帮助并分享反馈。
如果需要更快、成本更低的图像生成,请使用 Gemini 2.5 Flash Image;如果追求更高的图像生成质量,则可以选择 3 Pro Image,但成本和延迟也会更高。