Gemini 3.7 Flash输入$0.75/百万输出$3.75/百万,限时至2026年底;需注意minimal层级已下线并返回400错误,选型时需核查具体账单。
Gemini 3.7 Flash 于 2026-08-13 发布,每百万输入 token 0.75 美元,每百万输出 token 3.75 美元。关于这个价格,有两点很容易被忽略:它在 2026-12-31 到期,次日价格翻倍;Gemini 3.6 Flash 现在的定价与 3.7 Flash 完全相同。
真正影响构建的问题在别处。思考层级从四个减少到了三个。minimal 被移除了,而且它消失得并不安静。
价格: 2026-12-31 前 $0.75 输入 / $3.75 输出 每百万
2027-01-01 起 $1.50 / $7.50
Batch 和 Flex: $0.375 / $1.875,同样在到期日翻倍
缓存: 读取 $0.075,存储 $0.50 每百万 token 每小时
上下文: 1,048,576 输入 / 65,536 输出
思考: thinking_level low | medium | high,默认 medium
minimal 返回 HTTP 400
网关: ofox 上的 google/gemini-3.7-flash
实测: minimal 400 报错,none 和 xhigh 接受并计费
快照: 2026-08-21,每层级 10 次流式调用
最后更新于 2026-08-21。优惠价格截止到 2026-12-31,预算超此日期前请重新核实。
$0.75 输入,$3.75 输出,直到它不再是这样。Google 的定价页面把两个费率放在同一个单元格里,这就是为什么错误的数字会进到预算表格里。
上下文缓存读取价格为每百万 $0.075,存储价格为每百万 token 每小时 $0.50,两者都在同一日期翻倍。Search grounding 每月提供 5,000 次免费请求,在所有 Gemini 3.x 模型间共享(不是按模型分开),之后每 1,000 次 $14。
页面上有一行比标题价格更能决定你的账单:"Output price (including thinking tokens)"。推理按输出费率计费,所以 effort 设置是一个价格乘数,而不是一个带有舍入误差的质量旋钮。
不。两者价格完全相同,逐格对应。如果你看到有人说 3.7 Flash 是 3.6 Flash 的一半价格,这个对比的保质期大约只有一天,而定价页面自己的历史记录说明了原因。
2026-07-22,就在 3.6 Flash 于 2026-07-21 发布之后,根据存档的定价页面:3.6 Flash 收费 $1.50 / $7.50。
2026-08-12,根据 3.7 发布前的最后一份存档:3.6 Flash 仍然是 $1.50 / $7.50,没有折扣行。3.7 Flash 还未出现在页面上。
2026-08-13:3.7 Flash 发布。
2026-08-14,根据下一份存档:3.6 Flash 和 3.7 Flash 都显示 2026-12-31 前 $0.75 / $3.75,之后 $1.50 / $7.50。
2027-01-01:两者都恢复为 $1.50 / $7.50,这就是 3.6 Flash 首发日的价格。
所以基线在同一个 48 小时内发生了移动。Google 的模型卡注释了最终状态而没有说明:两行价格的星号都注明了优惠价格截止到 2026 年 12 月 31 日。从 3.6 升级不花一分钱也不节省一分钱。折扣买来的是四个半月的优惠,两个模型同等享有。
ofox 模型页面有 Google 页面没有细分的费率:缓存写入每百万 $0.0415,一小时缓存写入 $0.50,音频输入 $0.75,网络搜索每次请求 $0.014。
两条路线,唯一的区别是 base URL 和模型字符串。
from openai import OpenAI
client = OpenAI(api_key="sk-...", base_url="https://api.ofox.ai/v1")
r = client.chat.completions.create(
model="google/gemini-3.7-flash",
reasoning_effort="low",
messages=[{"role": "user", "content": "Rewrite this query with a window function"}],
)
print(r.choices[0].message.content)
直接调用 Google,模型字符串去掉 google/ 前缀,base URL 也要变:
client = OpenAI(
api_key="AIza...",
base_url="https://generativelanguage.googleapis.com/v1beta/openai/",
)
r = client.chat.completions.create(model="gemini-3.7-flash", reasoning_effort="low", messages=[...])
在 Google 原生协议中,参数不是 reasoning_effort,而是 thinking_level,接受 low、medium 和 high,默认是 medium。两条路线在 ofox 上都开放,Google 和 Cloud Vertex 作为上游。
功能特性值得从模型页面抄下来而不是靠 400 报错来发现:函数调用、结构化输出、上下文缓存、代码执行、搜索 grounding、URL 上下文、文件搜索和 Maps grounding 都支持,计算机使用标记为 Preview,Batch、Flex 和 Priority 都可用。Live API、图像生成和音频生成不支持。输入接受文本、图像、视频、音频和 PDF;输出仅限文本。
因为该层级被移除了,请求失败而不是降级处理。模型页面在 Thinking 下明确说明:Supported (low, medium, high),后面跟着 Note: minimal is not supported and returns an error。
我们还是发送了。经由 ofox 路线,reasoning_effort: "minimal" 返回 HTTP 400,错误信息:
{"error": {"code": null,
"message": "Thinking level is unsupported: THINKING_LEVEL_MINIMAL",
"param": null, "type": "invalid_request_error"}}
3.6 Flash 仍然接受 minimal,我们在它消失前测量了它在 3.6 Flash 上的表现。在 3.6 Flash 上,同样的提示词在 minimal 层级返回的中间值为 42 个完成 token,零个推理 token,首 token 时间为 1.36 秒。3.7 接受的最低层级 low,在 4.19 秒时返回了中间值 354 个 token。这意味着计费输出增加了 8.4 倍,等待时间增加了 3 倍,而模型的可见答案两边都是相同的 40 个 token。
所以迁移不是"改一下模型 ID 然后继续"。一个硬编码 minimal 的配置在换 ID 的那一刻就停止工作了,而最近的合法值悄无声息地增加了八倍成本。3.7 Flash 上没有零思考设置可以降级使用。
这个探测更有趣的另一半是哪些没有失败。none 和 xhigh 不是该模型的文档化值,两者都返回了 HTTP 200 且账单上有推理 token:在十次运行中,推理 token 的中间值分别为 271 和 604,即下表中 308 和 637 个完成 token。只有 minimal 被拒绝。200 状态码并不能确认你发送的值选中了其名称所暗示的层级——这和 GLM 5.3 用未文档化的 reasoning_effort 值设置的陷阱一样,验证在路线层面而不是模型层面。在上线前探测你自己的路线,因为"它返回了 200"和"它做了我要它做的事"是两回事。
Google 的 OpenAI 兼容性页面值得你花两分钟读一下:它的 reasoning_effort 映射表列出了 Gemini 3.1 Pro、3.1 Flash-Lite、 Gemini 3 Flash 和 2.5,没有 3.7 的列,它把 OpenAI 的 minimal 向下映射。模型页面说 3.7 拒绝 minimal。两个 Google 页面说法不一,你自己路由的一次简短探测就能确认实际情况。
相同的答案,最高可达账单的两倍。Mak,ofox 的产品负责人,在 2026-08-21 通过相同的 ofox 路线跑了每层级 10 次流式调用,一个简短的提示词(把 GROUP BY 重写为窗口函数),记录到第一个内容 token 的时间和 API 报告的用量。
10 次运行的中间值;范围是观察到的最小到最大值,随着增加运行次数会扩大,所以把它们当作离散度而非边界来理解。这一切都是同一个提示词在同一条路线上,参数处理在通往同一模型的不同路线上可能不同,所以把形状当作可迁移的,数字当作我们的。
答案的规模从不改变。看不见的那部分会变。文本 token 在每个层级都维持在 40 左右,因为模型被要求写的 SQL 语句不管思考多久都是 40 个 token。那条线以上的都是推理,按输出费率计费。仅输出部分按每百万 $3.75 计算,1,000 次这样的调用在 low 层级花费 $1.33,在 high 层级花费 $2.58;34 个 token 的提示词两边都只增加不到三分钱,所以 effort 设置在这个离散度中基本上做了所有的工作。
low 在其中一次运行中触底到 40 个完成 token,推理计数恰好为零;none 也出现了两次这种情况。medium 和 high 从来没有这样过,而这个底部正是它们范围分开的主要原因。
low 和 high 分得很清楚。low 和 medium 不行。high 的范围(560–806)与 low 的范围(40–418)不重叠,所以这个差距在这个提示词上是真实的。low 和 medium 在中间值上相差 30 个 token,范围在大部分跨度上重叠,这意味着十次运行无法在这里区分它们。medium 是否是一个有用的中间点取决于你的提示词,用你自己的跑大约四分钟就能回答。
未文档化的值不会失败,但也不会按其名称行事。none 返回 HTTP 200 并花费了中间值 271 个推理 token,这占了 low 花费的大部分。如果你把那个名字理解为关闭开关,你正在为你以为已经禁用的思考付钱。xhigh紧挨着 high。只有 minimal 被拒绝。
这一切并不与模型速度快这一事实相矛盾。Artificial Analysis 在 182 个模型的输出速度排名中将 3.7 Flash 排在第 1 位,达到每秒 389.5 个 token。在同一页面上,他们测量到在 Google 自有 API 上 high 档位的首个 token 耗时 14.52 秒,而同类价格竞品的中位数为 2.80 秒,且在我们这条路由上 high 档位看到的中位数大约是其两倍。这个等待发生在流式响应之前而非之内,这就是为什么用户感受到的是 effort 设置,而不是每秒 token 数。
Google 的模型卡发布了一份与 3.6 Flash、Claude Sonnet 5、GPT-5.6 Terra 和 Muse Spark 1.2 的对比表。其中差距真实存在的行如下:
长上下文检索、视频、前端代码和浏览器自动化是它的强项集中的领域。128k 针检索达到 97.0% 是表中唯一超过 95 的分数,而 AutomationBench 30.4% 对比 Sonnet 5 的 10.7% 这个差距,不是靠更好的提示词能追回来的。
弱点同样紧凑地集中在需要长时间运行的任务上。它在两个版本的 Terminal-bench 上都落后于 GPT-5.6 Terra:2.1 版本 85.8% 对比 87.4%,3.0 版本 14.9% 对比 20.8%。DeepSWE v1.1 也以 4.3 分落后于 Terra,GDPVal-AA v2 的 1525 在表中垫底。选择这个模型适合执行单步任务,而不是八小时无人值守循环。
表中有两项需要仔细阅读。CharXiv 是 3.7 落后于被替代模型的那一行,不带工具 84.5% 对比 85.2%,带工具 88.7% 对比 89.4%,所以涉及图表较多的多模态工作在换用前需要自己做 A/B 测试。还有 Terminal-bench 的两行是由厂商运行的。模型卡声称 Terminal-bench 2.1 为 85.8%,这高于公开 Terminal-Bench 2.1 排行榜榜首保持的 83.8% ± 1.2%(我们上次拉取时有 17 条已验证提交,且没有一条是 3.7 Flash 的)。一个自我报告的分数超越了已验证的榜首成绩,这是表中唯一需要将其作为声明而非结果来理解的数据。
模型卡中还有两行原文引述:知识截止日期是 2026 年 3 月,部分领域仍限于 2025 年 1 月,以及"可能偶尔出现缓慢或超时问题"。
如果你的工作负载不在那个强项列表中,ofox 的模型查找器会按质量、成本和速度对 100+ 个模型进行排名(针对选定的任务类型:编码、智能体、长文档 RAG、视觉、提取、翻译),实时拉取价格和上下文限制。无需注册、无需 API 密钥。
在 Artificial Analysis 智能指数上,四个模型彼此差距在三分以内,但价格差异超过 3 倍。下面的分数和费率来自 Google 模型卡,这是单一来源而非四个来源,所以在将其纳入预算之前请重新检查厂商页面。
四个模型中输出价格最低的,比 Terra 低 3.2 倍,综合得分落后一分。关键在于综合分:它隐藏了 terminal 和 GDPVal 这两行,3.7 Flash 在那里排名最后,所以把"可比"理解为对该指数的陈述而非其他。
再往下一行,3.6 Flash 现在价格相同但少了四分,这让它除了针对其行为已有调优提示词的情况外毫无优势。如果你仍在使用 3.6 Flash,我们之前的 3.6 Flash 成本对比 DeepSeek V4 Flash 有按任务计算的方法,而 3.1 Flash-Lite 预算智能体对比 覆盖了更低的层级。隔两代从 3.5 Flash 过来,编码智能体指南 对 3.7 仍然适用,只是模型 ID 不同,且缺少 minimal。
截至 2026-08-31,ofox 上15% 的顶价折扣使 google/gemini-3.7-flash 和 google/gemini-3.6-flash 位于同一个 OpenAI 兼容端点之后,这让上面片段中的 A/B 测试变成了一处字符串的修改。
Google: Gemini 3.7 Flash 模型页面
Google: Gemini API 定价
Google: thinking 和 thinking_level
Google: OpenAI 兼容性
DeepMind: Gemini 3.7 Flash 模型卡
Artificial Analysis: Gemini 3.7 Flash
Terminal-Bench 2.1 排行榜
Internet Archive: Gemini API 定价,2026-07-22
Internet Archive: Gemini API 定价,2026-08-12
Internet Archive: Gemini API 定价,2026-08-14
ofox 模型页面: Gemini 3.7 Flash
每百万输入 token 0.75 美元,每百万输出 token 3.75 美元,有效期至 2026 年 12 月 31 日,之后变为 1.50 美元和 7.50 美元。Google 的定价页将两行放在同一单元格中打印。Batch 和 Flex 半价,为 0.375 / 1.875 美元,在同一日期翻倍。输出价格包含思维 token,因此推理按输出费率计费。
不是的,两者定价相同。Google 的定价页对两个模型列出相同的四个层级和相同的两个日期。该页面的存档副本说明了为什么半价说法在与之对照时站不住脚:2026-08-12 时 3.6 Flash 为 1.50 / 7.50 美元固定价,3.7 Flash 未列出;到 2026-08-14 两者都显示为 0.75 / 3.75 美元至 2026-12-31。基准价在同样的 48 小时内被下调了。
因为 3.7 Flash 取消了这个层级。模型页面说明"注意:不支持 minimal,会返回错误。"在我们的探测中,请求返回 HTTP 400,错误信息为"Thinking level is unsupported: THINKING_LEVEL_MINIMAL",即 invalid_request_error。3.6 Flash 接受 minimal,所以任何硬编码该配置的代码在更换模型 ID 时会直接报错而非静默降级。
原生参数是 thinking_level,接受 low、medium 和 high,默认为 medium。通过 OpenAI 兼容层该参数是 reasoning_effort。我们在一个短提示词上测量了每个层级 10 次流式调用:low 返回的补全 token 中位数为 354,high 为 688,两个范围完全不重叠;而各层级可见答案都保持在 40 个 token 左右。
1,048,576 个输入 token 和 65,536 个输出 token。百万 token 窗口不代表能输出百万 token,因此长文档重写和整仓库生成仍需要分块。输入接受文本、图片、视频、音频和 PDF;输出仅为文本。
两者兼具,取决于你测量的是哪一半。Artificial Analysis 在输出速度上将其排为 182 个模型中的第 1 位,达到每秒 389.5 个 token;在同一页面上测量到在 Google 自有 API 上 high 档位的首个 token 耗时 14.52 秒,而同类价格竞品的中位数为 2.80 秒。首个 token 延迟与吞吐量是两回事,因为思维时间发生在第一个 token 之前:我们在一个短提示词上的中位数分别是 low 4.19 秒、medium 5.47 秒、high 7.69 秒。一个名为 Flash 的模型在高 effort 设置下仍然可以让用户等待。
在 Google 模型卡中打印的 Artificial Analysis 智能指数上,3.7 Flash 得 56 分,GPT-5.6 Terra 和 Muse Spark 1.2 得 57 分,Claude Sonnet 5 得 55 分。同一张卡列出它们的费率分别为每百万 token 2.00 / 12.00 美元、1.25 / 4.25 美元和 2.00 / 10.00 美元,因此 3.7 Flash 是四者中输出价格最低的。
在 ofox 上是 google/gemini-3.7-flash,可通过 OpenAI /v1/chat/completions 协议或 Google 原生 Gemini 协议调用。直接调用 Google 时代码是 gemini-3.7-flash,OpenAI 兼容的基础 URL 是 https://generativelanguage.googleapis.com/v1beta/openai/。
最初发表于 ofox.ai/blog。