同一1024×1024图像在不同视觉模型中计费从693到5486 token不等,价格差距达270倍。GPT-5.6用patch公式、Claude有缩放逻辑、Qwen按网格计费,三家文档与实测不符。
同一张 1024x1024 的图片,在 GPT-5.6 上消耗 693 个输入 token,在 Qwen 3.8 Max 上消耗 988 个,在 Gemini 上消耗 1,089 个,在 Claude 上消耗 1,372 个——将各提供商的实际输入费率 적용 后,15 个 vision 模型的费用从 $0.00005 到 $0.0137 不等,差距约 270 倍。五家厂商对外公布了图片计费规则,但我们的实测数据与其中三家的规则相悖。本文是前一篇文本分词器研究的图片篇:使用同一套本地生成的 PNG 图片送往目录中所有 vision 模型,用带图片的提示词 token 数减去不带图片的提示词 token 数,涵盖六个尺寸、五种宽高比、三种内容类型、三种文件格式,以及一至四张图片的组合。
一张 1024x1024 图片:GPT-5.6 消耗 693 token,Gemini 消耗 1,089,Claude 消耗 1,372;费用从 qwen3-vl-flash 的 $0.00005 到 claude-fable-5 的 $0.0137 不等。
三种计费方案:patch 公式(Qwen 的 (side/32)²+2 精确命中)、带上限的 tiles(GPT 止步于 693)、以及固定费率(Gemini 无论尺寸一律 1,089,连缩略图也不例外)。
三家的公开规则未能通过实测:Claude 旗舰款的缩放临界点约在 1,920px 而非文档所述的 1,568px;Gemini 按固定 1,089 计费而文档写的是 258;Qwen 的网格是 32px 而非 28。
文件格式和内容从未移动过一个 token:计费只看几何尺寸。
各家厂商如何描述图片计费方式?
七大家族中有五家发布了计费规则,其中三家规则未能通过实测。下面这张表就是全文的缩影;后续每一节要么是某处分歧的凭证,要么是文档从未提及的费用行为:
右列的规律值得专门命名:公开规则全都关乎几何(patch、tiles、除数),而几何是可测量的,所以我们测量了它。当两列出现分歧时,你的预算表格就继承了这个误差:一个按文档中 1,568px 上限来构建的 Claude 旗舰管道,在大图上会少算约 45% 的费用;而一个以为缩略图按 258 token 计费的 Gemini 管道,实际上每个图标要付 4.2 倍。
一张图片消耗多少 token?
在我们的矩阵中,答案是 6 到 5,486 不等,取决于模型和尺寸,而 token 数量只是账单的一半。以下是同一张 1024x1024 PNG 在目录中每个 vision 模型上的结果,并 applied 了各模型的输入费率:
三次读数。第一,计费逻辑字面意义:按每 token 约 0.75 个英文单词计算,一张 1024px 图片占据的上下文预算相当于 520 到 1,030 个单词的文档——这就是为什么图片密集的对话比纯文本更快耗尽上下文窗口和预算。第二,美元列几乎完全取决于费率:token 数量集中在 2 倍以内(693 到 1,379),所以在任何模型上一张图片的费用是其每 1,000 输入 token 收费的 0.69x 到 1.38x,而 270 倍的美元差距来自于费率,而非 vision 分词器。第三,家族共享分词器:两个 qwen3-vl 版本、两个 GPT-5.6 变体、全部三个 Gemini、以及全部四个 Claude 模型,在所有正方形图片上返回了相同或几乎相同的数值——与我们在文本上测出的每家族一个分词器规律一致。
什么决定了图片的 token 成本?
五个因素会影响账单,而三个广泛流传的假设因素则不会。本研究中其他所有内容都是对这张表某一行数据的深入探讨:
三个非因素值得明确指出,因为两种迷思都有流传:本矩阵中没有任何 API 将压缩比或图片复杂度计入账单。几何进,token 出。
三种计费方案是什么?
Patch 公式、带上限的 tiles、以及固定费率,它们对小图的定价方式完全不同。我们跑了一个六档尺寸阶梯,从 64px 到 2,048px 的正方形:

Qwen 公式足够精确可以用于预算:1,024px 正方形计费为 (1024/32)² + 2 = 1,026,精确到 token;有 padding 的最小值是 8x8 patches(66),缩放上限是 1,600px(从 1,600 到 1,920px 的图片全部精确计为 2,502)。GPT 用 tiles 计费直到 693 从不超出:1,024px 和 2,048px 的图片费用相同。固定费率的两位是缩略图流量的陷阱:Gemini 对 64px 图标按 1,089 token 计费,与 4K 截图经过缩放后的费用一样;Seed 按 1,298 计费。另一个极端,Kimi K3 持续攀升突破了所有人的上限:3,072px 正方形计费 11,674 token,是矩阵中唯一一个我们从未看到缩放的模型。
缩放边界具体在哪里?
除 Kimi 外所有家族都会在计费前对大图进行缩放,而且边界在仪表盘显示的位置,而不是文档记载的位置。Claude 的边界值得详细说明,因为它在 claude-sonnet-5 及以上版本的定价上涉及真金白银:1,568px 计 3,139 token,1,728px 计 3,847,1,920px 计 4,764,之后停止(2,048px 和 2,304px 也是 4,764)。旗舰三杰持续用真实像素计费约 45% 超过文档上限;claude-haiku-4-5 是唯一一个按文档描述行事的模型。如果你能控制上传管道,在编码前将图片缩放到各模型的实测上限:超过边界的像素要么被额外计费(Kimi),要么被静默丢弃(其他所有),所以超大图片上传只买了带宽,什么也没买到。
形状、内容或文件格式会改变账单吗?
我们实测到的每个形状效应都可以用两个因素解释,且都与文件大小无关:模型是按面积计费还是按边界网格计费,以及其长边缩放阈值在哪里。至于内容和格式,在任何地方都没有移动过一个 token:一张 512px 的纯色图片、噪点图和文字密集型页面在各模型上计费完全相同,同一张图片存为 243KB(PNG)、176KB(JPEG)和 174KB(WebP)也计费相同。
该因素探测将面积恒定在 1 百万像素,然后拉伸形状:
对着两个因素来读各行。Qwen、Kimi、Gemini 和 Seed 是平的:纯面积(或固定费率),没有形状项。GPT 是唯一的边界网格计费者,在 8:1 之前,条状图片比相同像素的正方形多付高达 84%,直到长边超过其限制,缩放退还了溢价:616 token,比正方形还便宜。缩放阈值家族在每个模型各自的边界处呈现同样的交叉:Haiku 从 3:1 开始打折(长边 1,774 超过其 1,568 上限:1,068,然后 788,然后 396),Claude 旗舰款只在 8:1 才开始(2,896 超过其约 1,920px 边界:1,107),MiniMax 在超过其 2,048 的 8:1 处(650)。对于宽文档和截图流量的实际意义:在 GPT 上,自己拆分或缩放条状图片;在 Haiku 上,极端形状是静默的最便宜 Claude 像素。
有哪些手段能真正降低图片输入成本?
三个,按杠杆顺序排列。第一,缩放到模型的上限:超过缩放边界的每个像素在 Kimi 上(有上限)都会被计费,在其他地方则是浪费。第二,detail: "low":在 GPT 上,512px 时什么都不变(两种设置都是 309),但在 2,048px 时会将图片锁定在 309 token,而 high 或 auto 是 693,降幅 55%,这是我们在任何模型上发现的唯一 per-request 图片调节旋钮。第三,让计费方案匹配工作负载:固定费率模型(Gemini、Seed)是缩略图和图标流量的错误归宿,却是始终如一的大尺寸扫描的正确选择;patch 和 tile 模型对小图定价更诚实(64px 图标在 GPT 上是 6 token,在 Kimi 上是 17)。
多图请求在任何地方都没有折扣:将 1 张、2 张、4 张相同图片堆叠在一个消息中,在全部 15 个模型上都是严格叠加计费,每张图片按其完整单图价格执行。这算术对固定费率方案伤害最大:一张 Gemini 请求中的四张 256px 缩略图要花 4,356 个图片 token,而 qwen3-vl-flash 上的四张同样尺寸缩略图只需 264。
一张 1024x1024 图片消耗多少 token?
在同一张 PNG 上实测:GPT-5.6 上 693,Qwen 3.8 Max 上 988,qwen3-vl 上 1,026,Gemini 上 1,089,ByteDance Seed 上 1,298,MiniMax 上 1,371,Claude 上 1,372,Kimi K3 上 1,379。2 倍的 token 差距没有 Applied 的费率影响大:美元费用从 qwen3-vl-flash 的 $0.00005 到 claude-fable-5 的 $0.0137 不等。
图片文件格式或压缩会影响 token 成本吗?
不影响,在我们测量的每个模型上都是如此:同一张 512px 图片存为 PNG(243KB)、JPEG(176KB)和 WebP(174KB)计费完全相同,纯色、噪点和文字密集型内容的计费也完全相同。计费只与像素尺寸有关;为带宽压缩,不要为 token 压缩。
detail: "low" 会减少图片 token 吗?
在 GPT-5.6 上是的,且仅在小型图片阈值以上才生效:2,048px 图片在 low 下计 309 token,而 high 或 auto 是 693(减少 55%),而在 512px 时三种设置都是 309。矩阵中没有其他模型暴露出可用的 per-request 图片成本调节旋钮。
如果把多张图片批量到一个请求里会更便宜吗?
不会:相同图片的 1 张、2 张、4 张副本在每个模型上都严格叠加计费,每张图片按全价。批量节省的是请求开销和延迟,不是图片 token,而在固定费率模型(Gemini、Seed)上,一个请求中放多张小图是最昂贵的形态。
测量时间:2026-08-13/14,通过 Synthorai 网关对 17 个模型(15 个 vision 模型、2 个纯文本对照)进行。本地生成精确尺寸的 PNG,图片成本以带图片的提示词 token 数减去加盐同文本基线的 token 数来读取;六档尺寸阶梯(64-2,048px),边界探测到 3,072px,六种 1MP 宽高形状(1:1 到 8:1 外加一个 1:4 竖塔),三种内容类型,PNG/JPEG/WebP,GPT 上的 detail low/high/auto,1/2/4 图片堆叠,以及每个模型上的代码词视觉检查。美元数字由测量之日各模型页面列出的输入费率乘以实测 token 数计算(Sonnet 5 按其 $2 的 introductory 费率)。Vision 计费规则随时变化;在依赖任何一个单一数值之前,重新跑一遍阶梯。