前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片
  • 场景篇按分类整理的大前端场景考点
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
  • 动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
  • AI 助手随时提问,即时解析
  • AI 模拟面试模拟真实面试 + 报告
  • AI 知识地图串起全站知识点
  • AI 定制路线按你的简历现排
AI 热点
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片
  • 场景篇按分类整理的大前端场景考点
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
  • 动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
  • AI 助手随时提问,即时解析
  • AI 模拟面试模拟真实面试 + 报告
  • AI 知识地图串起全站知识点
  • AI 定制路线按你的简历现排
AI 热点
旧版
返回 AI 情报前线
All News · 全部资讯9240
  • Oracle pgvector 生产翻车:1万向量后 RAG 质量急剧下降
  • OpenAI官方研究:组织如何使用ChatGPT
  • OpenAI 推出 Ultrafast 模式:GPT-5.6 Sol 速度快 14 倍
  • 有人在法律文书中隐藏提示注入,让 AI 裁定对其有利
  • 本地LLM vs 云端API:决策框架与成本计算器
  • ChatGPT Work和Codex新增Mac活动记忆功能
  • 程序员用编译器把《DOOM》渲染算法直接转成神经网络权重
  • GitOps风格管理AI Agent记忆与工具配置版本
  • Gemini 3.7 Flash 发布:编程能力提升50%降价一半
  • TraceMotive:面向 AI Agent 执行的本地优先调试器
  • AI 生成代码应视为假设:给免费模型答案分配错误预算
  • 依赖距离检测:AI 改动的爆炸半径分析脚本
  • 别盲目合并 AI Patch:Git Worktree Replay Gate 方法论
  • Anthropic研究:AI Agent会争抢地盘并自发合作
  • Claude Code 新会话默认启用 Auto 模式
  • OpenAI 发布 GPT-5.6 三子型号系列
  • Cerebras 刷新 GPT-5.6 推理速度纪录
  • AI Agent生产落地:从Prompt链式调用到基础设施架构
  • AI原生企业构建:从Copilot到自主运营
  • Google Meet 测试版推出 AI 会议笔记功能,Gemini 自动生成纪要
  • Gemini 3.7 Flash 发布: 编程/Agent 能力大幅提升,每百万 Token 0.75 美元
  • 测试套件绕过隔离写入生产数据库的真实事故复盘
  • AI 生成的认证中间件: undefined === undefined 导致认证绕过
  • DeepSeek开源Agent Harness:一切皆插件的Node.js运行时
  • Node.js 多 Provider 代码审查摘要方案:JSON Output 实战对比
  • Hugging Face整合机器人开发工具链
  • Trace 不是 Governance:Agent 系统长期运行的架构边界
  • LangGraph 多 Agent 流水线实战:18 天开发 doc2slides 的工程权衡
  • 自建 LLM 路由:用对模型省 28x 成本
  • 训练数据仅占 0.3%,却占输出 36%:微调模型的数据污染陷阱
  • Gemini 3.7 Flash发布
  • Gemini 3.7 Flash三周内连发
  • Google Sheets Canvas:自然语言构建交互式数据看板
  • CI/CD AI Agent 部署前需加人工审批门
  • MCP + RSS 目录:让 AI 工具获取领域最新信息
  • Agent工具调用200 OK背后的谎言:完成所有权问题
  • Google Sheets Canvas功能详解:打造互动数据看板
  • DeepSeek V4 Pro正式版发布,Agent框架Harness开源,API涨价
  • GPU 数值格式详解:FP32/BF16/FP8/FP4 交互式理解指南
  • 长时 Agent 循环如何设计记忆机制
  • 深度体验DeepSeek Harness:涨价也在情理之中
  • AWS AgentCore:统一监控多云/本地AI Agent
  • DFlash speculative decoding 测评:tokens/s 指标可能误导
  • Claude文本水印技术原理解析
  • 为什么AI demo便宜、上线后成本却翻10倍
  • 用 Bedrock AgentCore Browser Tool 自动化遗留 Web 系统
  • Liquid AI 发布 3B 端侧视觉语言模型
  • AI 编程 Agent 通过测试也可能做出架构错误决策
  • 基于 Bedrock AgentCore 构建 M&A 尽职调查多智能体系统
  • Token降价90%但我的AI账单没降:Jevons悖论在起作用
  • 我的Agent替我做营销:我只负责点批准
  • 已加载 51 / 9240
9.0
重磅
AI SCORE
模型发布2026-08-14 01:47

Gemini 3.7 Flash 发布: 编程/Agent 能力大幅提升,每百万 Token 0.75 美元

MarkTechPost#Google#Gemini#AI编程
Editor brief · 编辑速览

Google 发布 Gemini 3.7 Flash,编程基准 FrontierCode 1.1 从 34.4% 升至 43.6%,DeepSWE 达 65.3%,定价仅 $0.75/1M。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

Artificial Intelligence

Google 发布了 Gemini 3.7 Flash,这是其 Flash 系列中的最新模型,距离 Gemini 3.6 Flash 仅隔三周。模型说明文档将其描述为对 3.6 Flash 的优化,通过算法改进提升了核心推理能力——而非新的预训练。模型支持文本、图像、音频和视频输入,上下文窗口达 1M tokens,输出可达 64K tokens,并支持可配置的思考模式以在质量、成本和延迟之间做权衡。知识截止日期为 2026 年 3 月。能力提升主要集中在三个方面:软件工程、文档密集型知识工作和 Web 开发。更具说服力的是价格。Gemini 3.7 Flash 的定价为每 1M 输入 tokens 0.75 美元、每 1M 输出 tokens 3.75 美元——是 3.6 Flash 原价的五折,也大约是 Claude Sonnet 5 或 GPT-5.6 Terra 混合成本的三分之一。

是的,仅面向 API 和企业用户。没有开放权重。访问渠道包括:Gemini API 和 Google AI Studio、Google Antigravity、Android Studio、Gemini Enterprise Agent Platform 以及 Gemini Enterprise 应用。普通消费者可通过 Google AI Pro 和 Ultra 计划中的 Gemini Spark 使用。

公司适配:初创公司和中型团队获益最大,因为这个入门价格使得常驻 Agent 在没有 Pro 预算的情况下也变得可承受。受监管企业可以通过 Gemini Enterprise 获得合规路径。有数据主权或物理隔离(air-gap)需求的团队被排除在外——因为没有任何可以自托管的内容。

行业:Google 自评集指向法律、金融服务、生物科学和企业运营领域。Harvey LAB-AA、GDP.pdf 和 AutomationBench 的结果是关键指标。

应用场景:长时间运行的编码 Agent、文档密集型的后台办公自动化、从截图或设计系统生成 UI,以及 PDF 到结构化数据的管道处理。

基准测试全景

FrontierCode 1.1 Main(用于衡量生产代码质量)中,Gemini 3.7 Flash 得分为 43.6%,而 3.6 Flash 为 34.4%。在深度长期软件工程评估 DeepSWE v1.1 中,达到 65.3%。WebDev Arena 上的 Elo 评分为 1588 对比 1538,在 Google 的对比表中位居首位。

文档和工作流结果更进一步。GDP.pdf(专业 PDF 理解评估)从 22.0% 提升至 34.0%。AutomationBench(私有企业工作流集)从 17.0% 提升至 30.4%——分别领先 Claude Sonnet 5 的 10.7% 和 GPT-5.6 Terra 的 23.6%。128k 上下文长度的 GDM-MRCR v2 长上下文检索达到 97.0%。

GPT-5.6 Terra 在 DeepSWE(69.6%)、Terminal-bench 2.1(87.4%)、Terminal-bench 3.0(20.8%)和 OSWorld-2.0(50.2%)上领先。在知识工作 GDPval-AA v2 上,3.7 Flash 得分 1525 Elo,而 Sonnet 5 为 1598,Muse Spark 1.2 为 1628。CharXiv Reasoning 是一个退步:不带工具为 84.5%,低于 3.6 Flash 的 85.2%。在 Artificial Analysis Intelligence Index 上,3.7 Flash 得分 56,而 GPT-5.6 Terra 和 Muse Spark 1.2 均为 57。

定价才是真正的卖点

Gemini 3.7 Flash 定价为每 1M 输入 tokens 0.75 美元、每 1M 输出 tokens 3.75 美元。该价格为限时优惠,截止至 2026 年 12 月 31 日;2027 年 1 月 1 日起调整为 1.50 美元和 7.50 美元。在 Google 自家对比表中,Claude Sonnet 5 为 2.00/10.00 美元,GPT-5.6 Terra 为 2.00/12.00 美元。

以 80/20 的输入输出混合比例计算,当前的混合成本为每 1M tokens 1.35 美元,而 Sonnet 5 为 3.60 美元,GPT-5.6 Terra 为 4.00 美元。对于大规模运行 Agent 的团队来说,智能性价比差距才是评估的理由,而非单个基准测试的胜负。

Gemini 3.7 Flash 是 3.6 Flash 的优化版本,而非新的基础模型,发布仅隔三周。

编码能力提升是真实的:FrontierCode 43.6% 对比 34.4%,DeepSWE 65.3% 对比 48.6%,WebDev Arena 1588 Elo。

价格是最有力的卖点——每 1M tokens 0.75/3.75 美元,截止至 2026 年 12 月 31 日,之后价格翻倍。

GPT-5.6 Terra 在终端和计算机使用 Agent 上仍领先;CharXiv 有小幅退步。

仅面向 API 和企业用户。没有开放权重,因此无法自托管或物理隔离部署。

查看技术详情。此外,别忘了在 Twitter 上关注我们,加入我们 15 万+ 的 ML SubReddit 并订阅我们的通讯。你用 Telegram 吗?现在你也可以加入我们了。

需要与我们合作推广您的 GitHub 仓库或 Hugging Face 页面或产品发布或网络研讨会等?请联系我们

Asif Razzaq 是 Marktechpost Media Inc. 的 CEO。作为一位有远见的企业家和工程师,Asif 致力于将人工智能的潜力用于社会公益。他最近的举措是推出了一个人工智能媒体平台 Marktechpost,该平台以深入报道机器学习和深度学习新闻著称,既具有技术深度又易于广泛读者理解。该平台每月浏览量超过 200 万次,展示了其在受众中的受欢迎程度。

Original source

本文由 AI 翻译整理自 MarkTechPost,原文版权归原作者所有。

阅读英文原文
上一篇
Google Meet 测试版推出 AI 会议笔记功能,Gemini 自动生成纪要
下一篇
测试套件绕过隔离写入生产数据库的真实事故复盘