推出 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber 三个新版本。覆盖不同场景的重要模型更新。
我们最新的 Gemini 模型提供了规模化构建 AI Agent 所需的效率、低延迟和可靠性能。
——产品管理高级总监,代表 Gemini 团队
构建生产级 AI Agent 的开发者和客户需要更高的 token 效率、更低的延迟和更可靠的性能。我们的 Flash 系列模型正是为了满足效率与质量的平衡点而构建的,以支持 Agent 工作流的规模化。在 Gemini 3.5 Flash 的基础上,我们推出了新的 Gemini 模型:
3.6 Flash:我们的主力模型,提供更好的编码、知识工作和多模态性能。根据 Artificial Analysis Index,相比 3.5 Flash,它减少了 17% 的输出 token 用量,在一些基准测试(如 Datacurve 的 DeepSWE)中,我们观测到最高可达 65% 的减少,且输出 token 成本更低。
3.5 Flash-Lite:我们速度最快、成本最低的 3.5 级别模型,根据 Artificial Analysis Index,提供每秒 350 个输出 token 的吞吐量,在 Agent 工作流中的性能也明显超越之前的 Flash-Lite 世代。
3.5 Flash Cyber in CodeMender:成功的网络安全应用需要精心编排模型与 Agent 基础设施。我们推出了一个新的、高效的、专门针对网络安全的模型与我们的 CodeMender 代码安全 Agent 的组合,在前沿性能上交付有竞争力的成果。
除了今天的发布,Gemini 3.5 Pro 目前正在与合作伙伴进行测试,我们计划在准备就绪后尽快广泛推出。同时,我们的团队已经在专注于构建下一代模型。我们已启动迄今为止最雄心勃勃的预训练运行,用于 Gemini 4,并对进展感到兴奋。
Gemini 3.6 Flash 直接基于开发者和客户对 3.5 Flash 的反馈构建。3.6 Flash 不仅在编码和知识工作上有所提升,而且在 token 效率上有了显著改进。例如,在 Artificial Analysis Index 上,我们看到 3.6 Flash 的输出 token 消耗比 3.5 Flash 少 17%。完成多步骤工作流所需的推理步骤和工具调用次数也更少。
这种增强的效率同时结合了比 3.5 Flash 更低的价格。价格为 $1.50/1M 输入 token 和 $7.50/1M 输出 token,3.6 Flash 降低了每个 Agent 任务的总体成本,使 Agent 的构建和运行更具成本效益。
3.6 Flash 在 OSWorld 已验证任务(API)中展现出比 3.5 Flash 更好的 token 效率和更低的冗余度
尽管效率更高,3.6 Flash 在各种用例中的性能相比 3.5 Flash 有所提升:
3.6 Flash 在代码编辑方面精度更高,不需要的代码编辑更少,执行循环次数也减少了,如 DeepSWE 所示(49% vs. 37%),在 ML 研究方面显示出显著改进,如 MLE Bench 所示(63.9% vs. 49.7%)。
它的计算机使用能力有所改进,如 OSWorld-Verified 所示(83.0% vs. 78.4%)。计算机使用现在通过 Gemini API 和 Gemini Enterprise 作为内置客户端工具提供。
它在知识工作上的性能优于 3.5 Flash,如 GDPval-AA v2 等基准测试所示(1421 vs. 1349)。Hebbia 和 Harvey 等客户发现它特别擅长处理多模态任务,如文档解析、图表和数据分析以及报告起草。
3.6 Flash 在 AIS 上使用托管 Agent,可以比 3.5 Flash 更有效且准确地解析和分析财务数据与记录(AIS)
3.6 Flash 在 AGY 上使用多 Agent 编排执行代码迁移,延迟更低、质量更高(AGY)
3.6 Flash 帮助为 3D 工作流开发摄影纹理提取器,使用 canvas(Gemini App)
3.6 Flash 使用 AGY 和 tldraw 离线编辑器构建交互式主题工作室,充分利用其强大的视觉理解能力(AGY)。
客户反映 3.6 Flash 在成本和质量两个方面都是一大进步,在复杂工作流和知识密集型任务中平衡 token 效率、准确度和速度:
3.6 Flash 与强化的前沿安全防护措施一起发布,涵盖化学、生物、放射性和核(CBRN)以及网络攻击滥用领域。这些防护措施使模型对越狱攻击的抵抗力大大提强。同时,该模型经过训练以最小化对有益用途的拒绝。
如需更多信息,请参阅 3.6 Flash 模型卡。
除了 Flash,我们还发布 Gemini 3.5 Flash-Lite,专为低延迟任务和高吞吐量至关重要的开发者工作流(如 Agent 搜索和文档处理)而设计。
3.5 Flash-Lite 是 3.5 系列中速度最快的模型。根据 Artificial Analysis 的测量,它以每秒 350 个输出 token 的速率运行。价格为 $0.3/1M 输入 token 和 $2.5/1M 输出 token,质量显著优于 3.1 Flash-Lite,3.5 Flash-Lite 为运行高吞吐量生产流量的开发者和客户提供了强劲的性价比。
3.5 Flash-Lite 以比 3.5 Flash 更低的延迟执行大量任务。
3.5 Flash-Lite 支持 Agent 系统的高效规模化。在各思维级别上,该模型的性能明显优于 3.1 Flash-Lite。根据工作负载,开发者可以配置该模型以优先考虑低延迟、低成本的高容量任务执行(使用最小和低思维级别),或启用更高思维级别来处理多步骤子 Agent 工作负载。该模型现在也将计算机使用作为内置工具,可以跨各种界面可靠地支持这些 Agent 任务。
它在编码和 Agent 任务方面是一大进步,如 Terminal-Bench 2.1 所示(54% vs 31%),长上下文处理方面如 GDM-MRCR v2 所示(72.2% vs. 60.1%),以及真实世界任务执行方面如 GDPval-AA v2 所示(1140 vs. 642)。
事实上,在许多 Agent 和编码评估中,3.5 Flash-Lite 甚至优于 3 Flash,包括 SWE-Bench Pro(54.2% vs. 49.6%)和 OSWorld-Verified(74.0% vs. 65.1%),使其成为 2.5 和 3 Flash 工作负载的更快、更强大的选项。
3.5 Flash-Lite 从海量电商数据集中提取产品特征并合成。
作为主 Agent 与 3.6 Flash 并肩工作,3.5 Flash-Lite 能够立即生成 25 个独特的、可探索的网页设计概念。
3.5 Flash-Lite 可以通过其多模态理解能力扩展收据翻译和摘要工作。
3.5 Flash-Lite 通过立即生成并迭代多个选项来构建游戏。
3.5 Flash-Lite 的早期客户强调了其独特的速度、智能和成本效率组合在规模化 Agent 工作流和数据处理任务中的价值:
如需更多关于该模型的信息,请参阅 3.5 Flash-Lite 模型卡。
AI 模型已变得能够比现有系统更快地发现安全漏洞。应对这一日益增长的威胁需要一种高效且功能强大的软件安全保障方法。
Flash 的性能和效率使其成为大规模检测、验证和修复代码安全问题的理想基础。Gemini 3.5 Flash Cyber 基于 3.5 Flash 构建,并针对以比大型模型更低的单 token 价格发现和修复网络安全漏洞进行了微调。
在 CodeMender 中,多个 3.5 Flash Cyber Agent 协作产生单一的组合报告,3.5 Flash Cyber 在热门基准测试 CyberGym 上达到了前沿的竞争性能。
考虑到这项技术的双重用途性质,我们已采取谨慎的方式部署 3.5 Flash Cyber。该模型将通过 CodeMender 作为有限试点计划的一部分,仅对政府和受信任的合作伙伴提供。这将使前线防御者在漏洞被利用前发现和修复关键漏洞,同时降低更广泛滥用的风险。
3.6 Flash 和 3.5 Flash-Lite 从今天开始提供:
开发者可在 Gemini API 通过 Google AI Studio 和 Android Studio 获取。3.6 Flash 也在 Google Antigravity 中提供。通过开发者指南开始使用。
企业可在 Gemini Enterprise Agent Platform 获取。3.6 Flash 也在 Gemini Enterprise 应用中提供。
所有人都可通过 Gemini 应用获取。3.5 Flash-Lite 也在 Google Search 中推出。
当你开始使用 3.6 Flash 和 3.5 Flash-Lite 进行构建时,我们欢迎你的反馈,以改进未来的 Gemini 模型,并期待不久后发布 3.5 Pro。