Google 发布的 Gemini 3.7 Flash 在 SWE-bench 上获 65% 分数,并非此前宣传的 3.5 Pro,模型身份存疑。
Google 推出了新的 Gemini 模型,不,它不是 Gemini 3.5 Pro。Gemini 3.7 Flash 于周四上线,作为 Google 新的编码 Agent 和自动化业务工作流的主力模型——而就在三周前,Gemini 3.6 Flash 刚刚发布。
这么快的迭代节奏可能让人产生版本疲劳,但 Google 表示,新模型在代码编写和维持 Agent 稳定运行的长工作流处理上表现更好。Google 还搭配了一个优惠 API 价格——是 Gemini 3.6 Flash 原价的一半,但有一个附加条件:该价格将在 2027 年 1 月 1 日上调。
Google 表示,Gemini 3.7 Flash 在出现问题时更不容易卡住,也更擅长判断何时需要在继续之前获取更多信息。
编码基准测试大幅跃升
Google 表示,Gemini 3.7 Flash 在出现问题时更不容易卡住,也更擅长判断何时需要在继续之前获取更多信息。该模型在 FrontierCode 1.1 Main 上得分 43.6%,而 Gemini 3.6 Flash 仅为 34.4%。其 DeepSWE v1.1 得分从 49% 攀升至 65.3%。这一模式与 DeepSeek 小模型超越自身旗舰机型时如出一辙——更精简的模型始终在超越自身体量。其 WebDev Arena 分数升幅较为温和,从 1,538 升至 1,588。
但基准测试无法展示这一表现在企业自身环境中运行的可靠程度。Google 似乎专注于帮助 Agent 在代码库中顺畅工作而不卡死。如果 Gemini 3.7 Flash 能在初次尝试失败后恢复并更快得到正确结果,即使另一款模型表面成本更低,也可能节省时间和 token。
思考级别控制成本
Gemini 3.7 Flash 提供三种 thinking_level 设置:low、medium 和 high,默认使用 medium。
Low 适用于对延迟敏感的工作,如事故响应管道和实时聊天。Medium 在速度与编码和 Agent 工作流所需的推理能力之间取得平衡。High 允许模型在遇到困难的编码、数学或规划问题时花更多时间进行推理和使用工具。
路由 Agent 可能用 Low 就够了,而试图理清竞态条件的 Agent 可能需要 High。代价是成本:Gemini 花费越多时间进行推理和调用工具,消耗的 token 就越多——可以说更重要的是整个 Agent 循环中的总 token 消耗。
Gemini 3.7 Flash 目前价格为每百万输入 token 0.75 美元,每百万输出 token 3.75 美元。Google 将这一费率也适用于 Gemini 3.6 Flash,截止到 12 月 31 日。2027 年 1 月 1 日,两者的费率都将翻倍至每百万输入 token 1.50 美元和每百万输出 token 7.50 美元。Google 并非唯一使用激进定价策略赢得开发者青睐的公司——OpenAI 近期也在全球竞争加剧之际下调了自己的 API 价格。
这个优惠让团队有几个月时间在规模上测试 Gemini 3.7 Flash,但一旦价格上涨,携带大量上下文或花更多时间推理的 Agent 运行成本可能翻倍。无限投入的 AI 编码时代已经结束,因此围绕当前价格构建的团队需要在年初为此涨价做好规划。
无限投入的 AI 编码时代已经结束,因此围绕当前价格构建的团队需要在年初为此涨价做好规划。
迁移需要实实在在的工作
从 Gemini 3.5 Flash、Gemini 3 Flash Preview 或 Gemini 3.1 Pro 迁移过来的团队需要多做些工作。Google 的迁移指南指出,他们需要移除 temperature、top_p 和 top_k,用 thinking_level 设置替换数字 thinking_budget,并删除 candidate_count。
开发者还必须移除预填充的模型轮次。Google 建议围绕服务器端 previous_interaction_id 标准化多轮交互。使用 generateContent API 的应用程序应确保每个 FunctionResponse 都包含相应的调用 ID 和函数名。
这些更改是可以管理的,但工程师在信任其在生产环境中工作之前仍应进行测试。通过所有测试的代码仍可能在下一个 AI Agent 操作时崩溃——这提醒我们,测试覆盖率与 Agent 可靠性并不是一回事。
自动化收益仍属早期
改进不仅限于编码。Gemini 3.7 Flash 在 GDP.pdf 上得分 34%,高于之前的 22%,其 AutomationBench 分数从 17% 升至 30.4%。两者都是有意义的提升,尽管都不足以表明该模型可以放手不管。
刚刚迁移到 Gemini 3.6 Flash 的团队不需要从头开始。Google 尚未宣布将其下架的计划,这给开发者留出时间决定是否值得再次迁移。
与此同时,Gemini 3.5 Pro 仍然缺席。Google 承诺在 6 月发布,后来又说"即将"推出,此后已开始训练 Gemini 4。这是前沿实验室的常见问题:开发者等待的模型并不总是如期而至。
开发者等待的模型并不总是如期而至。