Google 发布 Gemini 3.7 Flash,编程基准 FrontierCode 1.1 从 34.4% 升至 43.6%,DeepSWE 达 65.3%,定价仅 $0.75/1M。
Artificial Intelligence
Google 发布了 Gemini 3.7 Flash,这是其 Flash 系列中的最新模型,距离 Gemini 3.6 Flash 仅隔三周。模型说明文档将其描述为对 3.6 Flash 的优化,通过算法改进提升了核心推理能力——而非新的预训练。模型支持文本、图像、音频和视频输入,上下文窗口达 1M tokens,输出可达 64K tokens,并支持可配置的思考模式以在质量、成本和延迟之间做权衡。知识截止日期为 2026 年 3 月。能力提升主要集中在三个方面:软件工程、文档密集型知识工作和 Web 开发。更具说服力的是价格。Gemini 3.7 Flash 的定价为每 1M 输入 tokens 0.75 美元、每 1M 输出 tokens 3.75 美元——是 3.6 Flash 原价的五折,也大约是 Claude Sonnet 5 或 GPT-5.6 Terra 混合成本的三分之一。
是的,仅面向 API 和企业用户。没有开放权重。访问渠道包括:Gemini API 和 Google AI Studio、Google Antigravity、Android Studio、Gemini Enterprise Agent Platform 以及 Gemini Enterprise 应用。普通消费者可通过 Google AI Pro 和 Ultra 计划中的 Gemini Spark 使用。
公司适配:初创公司和中型团队获益最大,因为这个入门价格使得常驻 Agent 在没有 Pro 预算的情况下也变得可承受。受监管企业可以通过 Gemini Enterprise 获得合规路径。有数据主权或物理隔离(air-gap)需求的团队被排除在外——因为没有任何可以自托管的内容。
行业:Google 自评集指向法律、金融服务、生物科学和企业运营领域。Harvey LAB-AA、GDP.pdf 和 AutomationBench 的结果是关键指标。
应用场景:长时间运行的编码 Agent、文档密集型的后台办公自动化、从截图或设计系统生成 UI,以及 PDF 到结构化数据的管道处理。
基准测试全景
FrontierCode 1.1 Main(用于衡量生产代码质量)中,Gemini 3.7 Flash 得分为 43.6%,而 3.6 Flash 为 34.4%。在深度长期软件工程评估 DeepSWE v1.1 中,达到 65.3%。WebDev Arena 上的 Elo 评分为 1588 对比 1538,在 Google 的对比表中位居首位。
文档和工作流结果更进一步。GDP.pdf(专业 PDF 理解评估)从 22.0% 提升至 34.0%。AutomationBench(私有企业工作流集)从 17.0% 提升至 30.4%——分别领先 Claude Sonnet 5 的 10.7% 和 GPT-5.6 Terra 的 23.6%。128k 上下文长度的 GDM-MRCR v2 长上下文检索达到 97.0%。
GPT-5.6 Terra 在 DeepSWE(69.6%)、Terminal-bench 2.1(87.4%)、Terminal-bench 3.0(20.8%)和 OSWorld-2.0(50.2%)上领先。在知识工作 GDPval-AA v2 上,3.7 Flash 得分 1525 Elo,而 Sonnet 5 为 1598,Muse Spark 1.2 为 1628。CharXiv Reasoning 是一个退步:不带工具为 84.5%,低于 3.6 Flash 的 85.2%。在 Artificial Analysis Intelligence Index 上,3.7 Flash 得分 56,而 GPT-5.6 Terra 和 Muse Spark 1.2 均为 57。
定价才是真正的卖点
Gemini 3.7 Flash 定价为每 1M 输入 tokens 0.75 美元、每 1M 输出 tokens 3.75 美元。该价格为限时优惠,截止至 2026 年 12 月 31 日;2027 年 1 月 1 日起调整为 1.50 美元和 7.50 美元。在 Google 自家对比表中,Claude Sonnet 5 为 2.00/10.00 美元,GPT-5.6 Terra 为 2.00/12.00 美元。
以 80/20 的输入输出混合比例计算,当前的混合成本为每 1M tokens 1.35 美元,而 Sonnet 5 为 3.60 美元,GPT-5.6 Terra 为 4.00 美元。对于大规模运行 Agent 的团队来说,智能性价比差距才是评估的理由,而非单个基准测试的胜负。
Gemini 3.7 Flash 是 3.6 Flash 的优化版本,而非新的基础模型,发布仅隔三周。
编码能力提升是真实的:FrontierCode 43.6% 对比 34.4%,DeepSWE 65.3% 对比 48.6%,WebDev Arena 1588 Elo。
价格是最有力的卖点——每 1M tokens 0.75/3.75 美元,截止至 2026 年 12 月 31 日,之后价格翻倍。
GPT-5.6 Terra 在终端和计算机使用 Agent 上仍领先;CharXiv 有小幅退步。
仅面向 API 和企业用户。没有开放权重,因此无法自托管或物理隔离部署。
查看技术详情。此外,别忘了在 Twitter 上关注我们,加入我们 15 万+ 的 ML SubReddit 并订阅我们的通讯。你用 Telegram 吗?现在你也可以加入我们了。
需要与我们合作推广您的 GitHub 仓库或 Hugging Face 页面或产品发布或网络研讨会等?请联系我们
Asif Razzaq 是 Marktechpost Media Inc. 的 CEO。作为一位有远见的企业家和工程师,Asif 致力于将人工智能的潜力用于社会公益。他最近的举措是推出了一个人工智能媒体平台 Marktechpost,该平台以深入报道机器学习和深度学习新闻著称,既具有技术深度又易于广泛读者理解。该平台每月浏览量超过 200 万次,展示了其在受众中的受欢迎程度。