Google 推出更快更便宜的 Gemini 3.1 轻量版本,针对成本和延迟敏感的 AI 应用场景优化。
为你的大规模工作负载提供一流的智能化能力。
你的浏览器不支持音频元素。
Gemini 3.1 Flash-Lite 现已通过 Google AI Studio 中的 Gemini API 向开发者提供预览版,企业可通过 Vertex AI 访问。定价为输入 token 每百万 $0.25,输出 token 每百万 $1.50,具有成本效益,速度也快于 2.5 Flash。可将 3.1 Flash-Lite 用于翻译、内容审核、生成用户界面和创建模拟等任务。
Google 推出了一个名为 Gemini 3.1 Flash-Lite 的新 AI 模型。它超快超廉价,所以更多人能用到它。这个 AI 在翻译语言和检查内容等方面表现出色。一些公司已经在用它来解决难题,因为它既聪慧又高效。
今天,我们推出 Gemini 3.1 Flash-Lite,这是我们速度最快、成本效益最高的 Gemini 3 系列模型。3.1 Flash-Lite 为大规模的高容量开发者工作负载而设计,在其价位和模型层级中提供高质量。
从今天开始,3.1 Flash-Lite 通过 Google AI Studio 中的 Gemini API 向开发者推出预览版,企业则通过 Vertex AI 获取。
定价仅为输入 token 每百万 $0.25,输出 token 每百万 $1.50,3.1 Flash-Lite 以更低成本相比大型模型提供更强性能。根据 Artificial Analysis 基准测试,它超越 2.5 Flash,首个 Answer Token 的时间快 2.5 倍,输出速度提升 45%,同时保持相当或更好的质量。这种低延迟对高频工作流至关重要,使其成为开发者构建响应迅速、实时体验的理想模型。
Gemini 3.1 Flash-Lite 在速度和质量上都超越了 2.5 Flash。
3.1 Flash-Lite 在 Arena.ai 排行榜上取得了令人印象深刻的 1432 Elo 分数,在推理和多模态理解基准上超越同等级其他模型,包括在 GPQA Diamond 上达到 86.9%,在 MMMU Pro 上达到 76.8%,甚至超越了 2.5 Flash 等前代更大的 Gemini 模型。
除了原始性能外,Gemini 3.1 Flash-Lite 在 AI Studio 和 Vertex AI 中标配了 thinking levels,让开发者能够灵活控制和选择模型对一个任务"思考"的深度,这对管理高频工作负载至关重要。3.1 Flash-Lite 可以大规模处理任务,如成本为优先考虑的高容量翻译和内容审核。它也能处理需要更深入推理的复杂工作负载,比如生成用户界面和仪表板、创建模拟或遵循指令。
3.1 Flash-Lite 瞬间为电商线框图填充数百个不同类别的产品。
3.1 Flash-Lite 可以实时生成动态天气仪表板,利用实时预报和历史数据。
3.1 Flash-Lite 可以创建一个 SaaS agent,能够为业务执行多功能的多步任务。
3.1 Flash-Lite 能够快速分析和排序大量图像等内容。
AI Studio 和 Vertex AI 的早期访问开发者,以及 Latitude、Cartwheel 和 Whering 等公司已在使用 3.1 Flash-Lite 大规模解决复杂问题。早期测试者称赞了 3.1 Flash-Lite 的效率和推理能力,表示它能以大型模型的精度处理复杂输入,同时能遵循指令并保持一致性。
我们期待看到你用 3.1 Flash-Lite 和 Gemini 3 系列其他模型构建的成果。