Google 宣布 Gemini 2.5 Flash-Lite 正式进入生产,具备百万 token 超长上下文、多模态、成本优势,适合大规模应用。
今天,我们发布了 Gemini 2.5 Flash-Lite 的稳定版本,这是我们在 Gemini 2.5 模型系列中速度最快、成本最低的模型(输入价格为每百万 token 0.10 美元,输出价格为每百万 token 0.40 美元)。我们构建 2.5 Flash-Lite 的目标是推进每美元智能的前沿,具有可选开启的原生 reasoning 能力,适用于更具挑战性的用例。基于 2.5 Pro 和 2.5 Flash 的势头,这个模型完善了我们准备用于大规模生产的 2.5 模型系列。
Gemini 2.5 Flash-Lite 在性能和成本之间取得平衡,而不牺牲质量,特别是对于翻译和分类等延迟敏感的任务。
它的优势如下:
业界最佳速度: Gemini 2.5 Flash-Lite 在广泛的 prompt 样本上的延迟低于 2.0 Flash-Lite 和 2.0 Flash。
成本效益: 这是我们成本最低的 2.5 模型,输入 token 定价为 $0.10/100 万,输出 token 定价为 $0.40/100 万,让你可以以经济的方式处理大量请求。我们还将音频输入价格从预览版发布时降低了 40%。
智能精巧: 在包括编码、数学、科学、reasoning 和多模态理解在内的广泛基准测试中,它展示了比 2.0 Flash-Lite 更全面的高质量。
功能完整: 当你使用 2.5 Flash-Lite 构建时,你可以访问 100 万 token 的上下文窗口、可控的思考预算,以及对原生工具(如 Google Search Grounding、代码执行和 URL Context)的支持。
自 2.5 Flash-Lite 发布以来,我们已经看到了一些令人难以置信的成功部署,以下是我们最喜欢的一些案例:
Satlyt 正在构建一个分散式太空计算平台,将改变卫星数据的处理和利用方式,用于轨道内遥测的实时汇总、自主任务管理和星间通信解析。2.5 Flash-Lite 的速度使其关键车载诊断的延迟降低了 45%,与基线模型相比功耗降低了 30%。
HeyGen 使用 AI 为视频内容创建化身,并利用 Gemini 2.5 Flash-Lite 来自动化视频规划、分析和优化内容、以及将视频翻译成超过 180 种语言。这使他们能够为用户提供全球化、个性化的体验。
DocsHound 使用 Gemini 2.5 Flash-Lite 处理长视频并以低延迟提取数千张截图,将产品演示转变为文档。这比传统方法更快地将视频转变为全面的文档和 AI agent 的训练数据。
Evertune 帮助品牌了解它们在 AI 模型中的表现。Gemini 2.5 Flash-Lite 对他们来说是一个游戏改变者,大大加快了分析和报告生成的速度。其快速的性能使他们能够快速扫描和综合大量的模型输出,为客户提供动态、及时的洞察。
你可以通过在代码中指定 gemini-2.5-flash-lite 来开始使用 2.5 Flash-Lite。如果你正在使用预览版本,你可以切换到 gemini-2.5-flash-lite,这是相同的底层模型。我们计划在 8 月 25 日移除 Flash-Lite 的预览版别名。
准备好开始构建了吗?立即在 Google AI Studio 和 Vertex AI 中尝试 Gemini 2.5 Flash-Lite 的稳定版本。