前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
返回 AI 情报前线
All News · 全部资讯8356
  • Lambda 容器镜像部署模型调用实战
  • Lambda 冷启动:Init 时长 vs 模型调用时长的真相
  • Lambda 调用 Bedrock 的 AccessDeniedException 排障
  • K8s GPU 节点池:Taint/Toleration 避坑指南
  • 模型加载慢?K8s 探针配置正确姿势
  • KoboldCpp 上下文切换原理深度解析
  • Provider迁移期间如何避免两套Prompt版本漂移
  • 模型术语差异:Anthropic与OpenAI同名不同义的技术词汇详解
  • ChatGPT Work:桌面自动化、记忆与治理,OpenAI进军AI工作流
  • 流式Chat接口集成测试:压缩、中间件与SSE帧边界的坑
  • Writer基于GLM-5.2开源版推出低成本AI模型
  • AI实现前先写ADR和SDD:让AI在有上下文的条件下做设计决策
  • GPT-4o Strict JSON Schema:端到端强制输出格式的原理与限制
  • Gemini 代码执行工具原理解析
  • RAG Pipeline需要出口匝道:何时该拒答或转人工
  • Qwen 3.5/3.6/3.8全系修复版Jinja对话模板
  • 2026年AI协调缺口:多Agent生产系统的工程框架
  • 提示注入是架构问题:硬件隔离才是解法
  • 用AI Agent和MCP协议调试Shopify webhook
  • React Flow + TypeScript 构建节点式流编辑器
  • Gemini 3.7 Flash 现身 SWE-bench:65% 通过率非 Pro 版
  • LLM 推理日志加密块藏有 704 个隐私泄露风险
  • SharePoint CVE-2026-55040 正被大规模利用
  • 非开发者用Agent Coding构建生产系统的经验: Eval是关键
  • Vim技能衰退与AI代码审查实践
  • 1.5B 参数模型本地跑 Shell 命令,1 秒出结果
  • llm-gemini 0.33:Simon Willison的AI CLI工具链支持Gemini 3.7
  • 多Agent平台工程:自适应推理深度节省thinking token
  • Oracle pgvector 生产翻车:1万向量后 RAG 质量急剧下降
  • OpenAI官方研究:组织如何使用ChatGPT
  • OpenAI 推出 Ultrafast 模式:GPT-5.6 Sol 速度快 14 倍
  • 有人在法律文书中隐藏提示注入,让 AI 裁定对其有利
  • 本地LLM vs 云端API:决策框架与成本计算器
  • ChatGPT Work和Codex新增Mac活动记忆功能
  • 程序员用编译器把《DOOM》渲染算法直接转成神经网络权重
  • GitOps风格管理AI Agent记忆与工具配置版本
  • Gemini 3.7 Flash 发布:编程能力提升50%降价一半
  • TraceMotive:面向 AI Agent 执行的本地优先调试器
  • AI 生成代码应视为假设:给免费模型答案分配错误预算
  • 依赖距离检测:AI 改动的爆炸半径分析脚本
  • 别盲目合并 AI Patch:Git Worktree Replay Gate 方法论
  • Anthropic研究:AI Agent会争抢地盘并自发合作
  • Claude Code 新会话默认启用 Auto 模式
  • OpenAI 发布 GPT-5.6 三子型号系列
  • Cerebras 刷新 GPT-5.6 推理速度纪录
  • AI Agent生产落地:从Prompt链式调用到基础设施架构
  • AI原生企业构建:从Copilot到自主运营
  • Google Meet 测试版推出 AI 会议笔记功能,Gemini 自动生成纪要
  • Gemini 3.7 Flash 发布: 编程/Agent 能力大幅提升,每百万 Token 0.75 美元
  • 测试套件绕过隔离写入生产数据库的真实事故复盘
  • AI 生成的认证中间件: undefined === undefined 导致认证绕过
  • 已加载 51 / 8356
8.0
热点
AI SCORE
模型发布2026-08-14 03:59

Gemini 3.7 Flash 现身 SWE-bench:65% 通过率非 Pro 版

The New Stack#Google#Gemini#AI编程
Editor brief · 编辑速览

Google 发布的 Gemini 3.7 Flash 在 SWE-bench 上获 65% 分数,并非此前宣传的 3.5 Pro,模型身份存疑。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

Google 推出了新的 Gemini 模型,不,它不是 Gemini 3.5 Pro。Gemini 3.7 Flash 于周四上线,作为 Google 新的编码 Agent 和自动化业务工作流的主力模型——而就在三周前,Gemini 3.6 Flash 刚刚发布。

这么快的迭代节奏可能让人产生版本疲劳,但 Google 表示,新模型在代码编写和维持 Agent 稳定运行的长工作流处理上表现更好。Google 还搭配了一个优惠 API 价格——是 Gemini 3.6 Flash 原价的一半,但有一个附加条件:该价格将在 2027 年 1 月 1 日上调。

Google 表示,Gemini 3.7 Flash 在出现问题时更不容易卡住,也更擅长判断何时需要在继续之前获取更多信息。

编码基准测试大幅跃升

Google 表示,Gemini 3.7 Flash 在出现问题时更不容易卡住,也更擅长判断何时需要在继续之前获取更多信息。该模型在 FrontierCode 1.1 Main 上得分 43.6%,而 Gemini 3.6 Flash 仅为 34.4%。其 DeepSWE v1.1 得分从 49% 攀升至 65.3%。这一模式与 DeepSeek 小模型超越自身旗舰机型时如出一辙——更精简的模型始终在超越自身体量。其 WebDev Arena 分数升幅较为温和,从 1,538 升至 1,588。

但基准测试无法展示这一表现在企业自身环境中运行的可靠程度。Google 似乎专注于帮助 Agent 在代码库中顺畅工作而不卡死。如果 Gemini 3.7 Flash 能在初次尝试失败后恢复并更快得到正确结果,即使另一款模型表面成本更低,也可能节省时间和 token。

思考级别控制成本

Gemini 3.7 Flash 提供三种 thinking_level 设置:low、medium 和 high,默认使用 medium。

Low 适用于对延迟敏感的工作,如事故响应管道和实时聊天。Medium 在速度与编码和 Agent 工作流所需的推理能力之间取得平衡。High 允许模型在遇到困难的编码、数学或规划问题时花更多时间进行推理和使用工具。

路由 Agent 可能用 Low 就够了,而试图理清竞态条件的 Agent 可能需要 High。代价是成本:Gemini 花费越多时间进行推理和调用工具,消耗的 token 就越多——可以说更重要的是整个 Agent 循环中的总 token 消耗。

Gemini 3.7 Flash 目前价格为每百万输入 token 0.75 美元,每百万输出 token 3.75 美元。Google 将这一费率也适用于 Gemini 3.6 Flash,截止到 12 月 31 日。2027 年 1 月 1 日,两者的费率都将翻倍至每百万输入 token 1.50 美元和每百万输出 token 7.50 美元。Google 并非唯一使用激进定价策略赢得开发者青睐的公司——OpenAI 近期也在全球竞争加剧之际下调了自己的 API 价格。

这个优惠让团队有几个月时间在规模上测试 Gemini 3.7 Flash,但一旦价格上涨,携带大量上下文或花更多时间推理的 Agent 运行成本可能翻倍。无限投入的 AI 编码时代已经结束,因此围绕当前价格构建的团队需要在年初为此涨价做好规划。

无限投入的 AI 编码时代已经结束,因此围绕当前价格构建的团队需要在年初为此涨价做好规划。

迁移需要实实在在的工作

从 Gemini 3.5 Flash、Gemini 3 Flash Preview 或 Gemini 3.1 Pro 迁移过来的团队需要多做些工作。Google 的迁移指南指出,他们需要移除 temperature、top_p 和 top_k,用 thinking_level 设置替换数字 thinking_budget,并删除 candidate_count。

开发者还必须移除预填充的模型轮次。Google 建议围绕服务器端 previous_interaction_id 标准化多轮交互。使用 generateContent API 的应用程序应确保每个 FunctionResponse 都包含相应的调用 ID 和函数名。

这些更改是可以管理的,但工程师在信任其在生产环境中工作之前仍应进行测试。通过所有测试的代码仍可能在下一个 AI Agent 操作时崩溃——这提醒我们,测试覆盖率与 Agent 可靠性并不是一回事。

自动化收益仍属早期

改进不仅限于编码。Gemini 3.7 Flash 在 GDP.pdf 上得分 34%,高于之前的 22%,其 AutomationBench 分数从 17% 升至 30.4%。两者都是有意义的提升,尽管都不足以表明该模型可以放手不管。

刚刚迁移到 Gemini 3.6 Flash 的团队不需要从头开始。Google 尚未宣布将其下架的计划,这给开发者留出时间决定是否值得再次迁移。

与此同时,Gemini 3.5 Pro 仍然缺席。Google 承诺在 6 月发布,后来又说"即将"推出,此后已开始训练 Gemini 4。这是前沿实验室的常见问题:开发者等待的模型并不总是如期而至。

开发者等待的模型并不总是如期而至。

Original source

本文由 AI 翻译整理自 The New Stack,原文版权归原作者所有。

阅读英文原文
上一篇
React Flow + TypeScript 构建节点式流编辑器
下一篇
LLM 推理日志加密块藏有 704 个隐私泄露风险