新一代 Gemini 模型发布,包括高性能版、轻量版和网络安全专项版,影响程序员模型选型。
我们最新的Gemini模型为大规模构建AI Agent提供了效率、延迟和可靠性。
产品管理高级总监,代表Gemini团队
为生产环境开发AI Agent的开发者和客户需要更高的token效率、更低的延迟和更可靠的性能。我们的Flash系列模型专为实现效率与质量的最优平衡而构建,以支持Agent工作流的规模化。基于Gemini 3.5 Flash,我们推出新的Gemini模型:
3.6 Flash:我们的主力模型,在编码、知识工作和多模态性能方面表现更出色。根据Artificial Analysis指数,与3.5 Flash相比,它的输出token使用量减少了17%,在DeepSWE等某些基准上,我们观察到可减少高达65%,同时每个输出token的成本更低。
3.5 Flash-Lite:我们最快、最经济的3.5级模型,根据Artificial Analysis指数,每秒可生成350个输出token,在Agent工作流方面也明显优于之前的Flash-Lite世代。
3.5 Flash Cyber in CodeMender:成功的网络安全应用需要谨慎编排模型和Agent基础设施。我们推出了一个结合新型高效专业化网络安全模型与我们CodeMender代码安全Agent的方案,能在前沿性能上提供竞争力。
除了今天的发布外,Gemini 3.5 Pro目前正与合作伙伴进行测试,我们计划在准备就绪后尽快推向大众。与此同时,我们的团队已经开始专注于构建下一代模型。我们已启动了迄今为止规模最大的预训练运行,用于Gemini 4,进展令人兴奋。
Gemini 3.6 Flash直接基于3.5 Flash的开发者和客户反馈构建。3.6 Flash不仅在编码和知识工作上有显著提升,而且在token效率上也有了明显改进。例如,在Artificial Analysis指数上,我们看到3.6 Flash的输出token消耗量比3.5 Flash少17%。它在完成多步工作流时也需要更少的推理步骤和工具调用。
这种增强的效率还结合了比3.5 Flash更低的价格。以$1.50/1M输入token和$7.50/1M输出token的价格,3.6 Flash降低了Agent任务的总体成本,使Agent的构建和运行更具成本效益。
3.6 Flash在OSWorld验证任务中展现了比3.5 Flash更好的token效率和更低的冗长性(API)
即使效率更高,3.6 Flash在各个用例上相比3.5 Flash都获得了性能提升:
3.6 Flash在DeepSWE中提供了更高的精确度、更少的不必要代码编辑和更少的执行循环(49% vs. 37%),在ML Research中表现明显改进,如MLE Bench所示(63.9% vs. 49.7%)。
它改进了计算机使用能力,如OSWorld-Verified所示(83.0% vs. 78.4%)。计算机使用现在是通过Gemini API和Gemini Enterprise提供的内置客户端工具。
它在知识工作上超越了3.5 Flash,如GDPval-AA v2基准所示(1421 vs. 1349)。Hebbia和Harvey等客户发现它在多模态任务(如文档解析、图表和数据分析、报告起草)上特别强大。
3.6 Flash在AIS上使用托管Agent,可以比3.5 Flash更高效、更准确地解析和分析财务数据和文本记录(AIS)
3.6 Flash在AGY上使用多Agent编排执行代码迁移,延迟更低、质量更高(AGY)
3.6 Flash帮助为3D工作流开发照相纹理提取器,使用canvas(Gemini App)
3.6 Flash利用AGY和tldraw离线编辑器构建交互式主题工作室,凭借其强大的视觉理解能力(AGY)。
客户报告3.6 Flash在成本和质量上都是一个进步,在复杂工作流和知识任务中平衡了token效率、准确性和速度:
3.6 Flash通过增强的前沿安全防护在化学、生物、放射性和核(CBRN)以及网络攻击滥用领域发布。这些防护使该模型对越狱攻击具有更强的抵抗力。与此同时,该模型已被训练以最小化对有益用途的拒绝。
更多信息,请参阅3.6 Flash模型卡。
除了Flash,我们还发布了Gemini 3.5 Flash-Lite,专为低延迟任务以及开发者工作流中高吞吐量至关重要的任务(如Agent搜索和文档处理)而设计。
3.5 Flash-Lite是3.5系列中最快的模型。根据Artificial Analysis的测量,它以350个输出token/秒的速率运行。价格为$0.3/1M输入token和$2.5/1M输出token,质量明显优于3.1 Flash-Lite,3.5 Flash-Lite为运行高吞吐量生产流量的开发者和客户提供了强有力的价格-性能比。
3.5 Flash-Lite以比3.5 Flash更低的延迟执行高容量任务。
3.5 Flash-Lite为Agent系统的高效规模化提供了支持。在所有思考水平上,该模型明显优于3.1 Flash-Lite。根据工作负载,开发者可以配置该模型在最小和低思考水平上优先考虑低延迟、低成本的高容量任务执行,或使用更高思考水平来处理多步子Agent工作负载。该模型现在还将计算机使用作为内置工具,以跨不同终端可靠地支持这些Agent任务。
在编码和Agent任务上它有显著进步,如Terminal-Bench 2.1所示(54% vs 31%),长上下文能力如GDM-MRCR v2所示(72.2% vs. 60.1%),以及真实世界任务执行如GDPval-AA v2所示(1140 vs. 642)。
实际上,在许多Agent和编码评估中,3.5 Flash-Lite甚至优于3 Flash,包括SWE-Bench Pro(54.2% vs. 49.6%)和OSWorld-Verified(74.0% vs. 65.1%),使其成为2.5和3 Flash工作负载的更快且更强大的选择。
3.5 Flash-Lite从大规模电商数据集中提取产品特性并合成。
在3.6 Flash作为主Agent的协作下,3.5 Flash-Lite瞬间生成25个独特的、可探索的网页设计概念。
3.5 Flash-Lite可以利用其多模态理解能力扩展收据翻译和总结。
3.5 Flash-Lite通过瞬间生成和迭代多个选项来构建游戏。
3.5 Flash-Lite的早期客户强调了它在扩展Agent工作流和数据处理任务方面速度、智能和成本效率的独特组合:
更多关于该模型的信息,请参阅3.5 Flash-Lite模型卡。
AI模型已变得能够比当前系统更快地查找安全漏洞。解决这一日益增长的威胁需要采用高度能力强且高效的软件安全方法。
Flash的性能和效率使其成为大规模检测、验证和修补代码安全问题的理想基础。Gemini 3.5 Flash Cyber建立在3.5 Flash之上,并针对以比更大模型更低的每token成本查找和修复网络安全漏洞进行了微调。
在CodeMender中,多个3.5 Flash Cyber Agent协同工作以生成单一综合报告,3.5 Flash Cyber在流行的CyberGym基准上达到了前沿的竞争性能。
鉴于这项技术的双用途性质,我们采取了有意的方法来部署3.5 Flash Cyber。该模型将通过CodeMender独家提供给政府和信任的合作伙伴,作为限制性访问试点计划的一部分,很快推出。这将使一线防御者能够率先查找和修复关键漏洞,防止其被利用,同时减轻更广泛的滥用风险。
3.6 Flash和3.5 Flash-Lite从今天开始可用:
针对Gemini API中的开发者通过Google AI Studio和Android Studio。3.6 Flash在Google Antigravity中也可用。通过开发者指南开始使用。
针对Gemini Enterprise Agent Platform中的企业。3.6 Flash在Gemini Enterprise应用中也可用。
面向所有人通过Gemini应用。3.5 Flash-Lite也在Google Search中推出。
当您开始使用3.6 Flash和3.5 Flash-Lite时,我们欢迎您的反馈以改进未来的Gemini模型,并期待不久后发布3.5 Pro。