开源基准测试工具衡量「每正确答案成本」「Agent 轨迹成本」和「按评分标准衡量的交付质量」,而非单纯比较 token 价格。
构建生成式 AI 应用的团队通常用同一种方式比较模型:每百万 token 多少美元。这个数字出现在每一家定价页上,于是就成了每张电子表格里的数字。但生产 workload 买的不是 token,而是结果:一张已解决的支持工单、一份已完成的研究简报、一份正确的财务摘要。在定价页和结果之间,存在着定价页忽略的乘数因子:模型正确的频率、得到正确答案需要多少 token,以及对于 Agent 化 workload,需要多少轮对话——因为每一轮都会重新发送不断增长的上下文。
在本文中,我们分享了来自一个开源基准测试工具的结果,该工具用于衡量 OpenAI 模型在 Amazon Bedrock 上的这些乘数因子(gpt-5.6-luna、gpt-5.6-terra 和 gpt-5.6-sol),以及 OpenAI API 上两个广泛使用的成本优化模型(gpt-5.4-mini 和 gpt-5.4-nano)。我们选择后两者作为成本优化的基线,是许多团队起步的选择,而不是作为同代对等物来比较,因为"我们目前跑的是 mini 或 nano,换成 Amazon Bedrock 上的新模型值得吗?"是我们听到最多的问题。我们聚焦在三个问题:
正确答案的成本是多少?不是 token 的成本。
Agent 轨迹的成本是多少?轮次数量可能主导账单。
它能产出专业人士愿意接受的工作成果吗?这是用真实的职业交付物来衡量的,而不是测验题。
这里的核心基准测试是可复现的:工具 openai-on-aws/benchmarks-openai 用同一条代码路径(OpenAI Responses API)运行两个应用,我们鼓励你在做任何决定之前在自己的任务上运行它。
该工具通过同一个 Responses API 客户端评估所有五个模型,在保持评估逻辑不变的情况下切换后端和模型 ID。结果仍然反映了模型、提供商基础设施和模型特定配置的差异。特别是,Amazon Bedrock 上的模型在禁用 reasoning 的情况下运行,而 OpenAI API 基线则使用其默认配置。这是对实际部署配置的比较,而不是对内在模型能力的受控估计。
我们衡量三个指标:在仍能区分前沿模型的基准测试上的单次调用准确率和成本(AIME 竞赛数学、GPQA Diamond 研究生级科学和 MMLU-Pro)、在实时网络研究任务上的多轮 Agent 轨迹,以及按评分标准评分专业交付物。评分结合了确定性检查和大语言模型(LLM)评判(gpt-5.5,不是被评估的模型之一),使用冻结的 prompt,其哈希值记录在每个结果文件中。每次运行写入一个带时间戳的结果 JSON,本文中的每个数字和图表都是在构建时从这些文件生成的。
如何阅读结果:样本量从 48 到 198 项不等。将小的差距视为方向性参考,除非有不确定性估计,否则在选择模型之前在自己的 workload 上复现评估。
对于每个基准测试,我们将模型的总支出(跨正确和错误尝试)除以其正确答案数量。这估算的是我们样本中正确答案的观察成本。下图显示了所有五个模型在 AIME 上的准确率和每个正确答案的成本。该模式在 GPQA Diamond 和 MMLU-Pro 上重复(完整表格在仓库中)。
图 1:AIME 准确率和五个模型每个正确答案的成本
有两个突出的发现:
在这个样本中可以看到能力层级。Sol 解决了 75% 的 AIME 问题,而 mini 是 37%,在 GPQA Diamond(68% 对比 43%)和 MMLU-Pro(82% 对比 59%)上也领先。如果尝试是独立的且准确率保持不变,37% 的准确率意味着平均大约需要 2.7 次尝试才能成功一次。实际重试是相关的,所以要衡量你实际的重试策略,而不是直接假设该估算值适用。
Token 效率在价格变动之前就决定了账单,然后价格才变动。以其原始标价(大约是 mini 的 1.5 倍),luna 在这个配置下每个正确 AIME 答案的成本已经比 mini 便宜 25%,因为在禁用 reasoning 的情况下,它使用的计费 token 比默认配置下的 mini 少。在 2026 年 7 月 30 日 Amazon Bedrock 上 GPT-5.6 Luna 和 Terra 降价之后(luna −80%,terra −20%),我们记录的每个正确 AIME 答案的成本是 luna $0.0021 对比 mini $0.0139。在这些样本中,luna 拥有最低的每个正确答案观察成本,包括对比 nano,尽管 nano 的名义 token 价格在我们记录结果文件中的价格假设下略低。定价说明:结果文件目前使用 luna 每 1M 输入/输出 token $0.22/$1.32,terra 为 $2.20/$13.20。在发布之前,请根据实时定价页确认适用的 Amazon Bedrock 推理层级和区域。7 月 30 日的公告描述了第一方价格平价,而定价页更新可能有延迟。对于客户来说,更有用的模型选择问题不仅是"哪个 token 最便宜?"而是"在业务可接受的质量水平下,哪个每个结果的成是最低的?"
单次调用定价忽略了我们 Agent 化 workload 的一个定义性特征。该工具使用 client-managed history 且 store: false,所以每一轮都重新发送 system prompt、之前的工具结果和对话上下文。每轮上下文大约线性增长。因此,累计计费输入可能随轮次数量近似二次增长。每一轮也增加了一轮往返延迟。一个在五轮而不是八轮内完成的模型可以节省超过轮次减少 37% 本身所暗示的成本。
为了在真实 workload 上衡量这一点,我们通过一个带有真实 web_search 和 fetch_page 工具的实时 Agent 循环,运行了 DeepSearchQA(多步网络研究问题)的 50 道题分层样本。答案使用确定性预通过后跟一个冻结的 gpt-5.5 自动评分器进行评分。问题在 F1 ≥ 0.7 时通过。下图显示了轮次数量如何推动输入 token 量(左侧)以及每个通过答案最终花费了多少(右侧)。
图 2:轮次数量推动输入 token 量和每个 DeepSearchQA 通过答案的成本
左图是机制。右图是结果。Mini 每个问题花费的轮次最多(7.6,主要是重新搜索循环),而每一轮都重新发送包含累积搜索结果的上下文。到最后,这达到了 terra 输入 token 量的 2.3 倍(每个问题 114k 对比 50k token)。在这个样本中,terra 更高的 token 价格被更少的轮次和更高的质量所抵消:每个通过答案的成本为 $0.31,而 mini 为 $0.40,平均 F1 分别为 0.50 和 0.39。三个 GPT-5.6 配置记录的平均 F1 高于两个基线,而 luna 结合了比 mini 更少的轮次,每个通过答案 $0.05 对比 mini 的 $0.40。Nano 的名义 token 价格较低,但在 18% 的通过率下,每个通过答案的观察成本为 $0.07,而 luna 为 $0.05。使用 50 个问题,将接近的差距视为方向性参考。
客户要点:轮次效率是一个定价变量,但它在定价页上是看不见的。如果你的 Agent 链式调用工具(研究、多跳查询、迭代检索),在调用成本旁边对轨迹成本进行基准测试。
基准测试给答案评分。客户交付的很多东西是文档,如合规简报、财务计划 和护理方案,其中"正确"是一个评分标准,而不是字符串匹配。因此,我们运行了 GDPval 的 48 个任务切片:来自平均 14 年经验的专业人士创建的真实职业交付物,每个都根据其人工编写的评分标准进行评分。交付物在加权评分标准积分 ≥70% 时通过。下图显示了通过率和每个通过交付物的成本。
图 3:GDPval 通过率和每个通过交付物的成本
所有三个 gpt-5.6 配置都实现了比禁用 reasoning 的 mini 和 nano 更高的观察评分标准分数。最大的观察差异出现在法律、护理和财务建议任务中,这些任务的评分标准要求特定的警示事项、结构和完整性。每个类别的样本很小,所以将此模式视为探索性的。Luna 在 48 个交付物中的 31 个上得分高于 mini,9 个低于 mini,8 个持平。它通过了 27 个交付物,而 mini 为 20 个。
这个 workload 是单次调用,没有轮次效应,所以在重新定价之前,mini 和 nano 每个通过交付物更便宜,gpt-5.6 购买了通过率。重新定价后,luna 在这个样本中拥有最低的观察成本:每个通过交付物 $0.010,而 mini 为 $0.030,nano 为 $0.012,通过率为 56%,而 mini 为 42%,nano 为 35%。Terra 和 sol 在记录更高评分标准表现的同时,仍需为每次通过支付溢价。这个溢价是否合理取决于目标 workflow 中审查和返工的成本。
GDPval 说明:输出被限制在 8,192 token,截断了 6 个 luna、9 个 terra、7 个 sol、0 个 mini 和 1 个 nano 交付物。这些是在测试限制下的真实结果。更高的限制可能会提高质量,但也可能增加成本。将两者一起测试。
如果你目前运行的是 gpt-5.4-mini 或 nano,迁移问题取决于 workload 形态:
我们还使用相同的流式工具测量了两个应用上同模型的延迟。在我们 2026 年 7 月的运行中(us-west-2,单区域和单点时间),Amazon Bedrock 上 luna 的首 token 时间(median time-to-first-token)平均低 21%,terra 平均低 5%,跨越 12 个匹配配置。共享服务随负载变化,所以将这些视为快照并重新测量。在 ≥500 token 输出时,luna 在 Amazon Bedrock 上的吞吐量平均高 43%(terra +4%)。观察到的最坏情况 TTFT 与中位数比率在 Amazon Bedrock 上为 2.1–2.5 倍,而在 OpenAI API 上为 4.6–6.6 倍。这些最大值表示尾部可变性,但不是 p99 延迟的估计。Sol 的行为不同:它是一个深度推理模型,具有固有的长且可变的首 token 时间,其 Amazon Bedrock 运行使用 us-east-1。所有三个模型的每配置详细信息记录在仓库的性能部分,performance/run_all.sh 在你自己的账户上重现该比较。
这些结果反映了我们的样本量和配置选择:每个套件 50–198 个问题(DeepSearchQA 50、AIME 60、MMLU-Pro 140、GPQA Diamond 198),48 个交付物,以及 Amazon Bedrock 上模型的 reasoning 禁用,这是一个有意的成本下限。启用它会同时提高质量和支出。你的任务不是我们的任务。方法是持久的部分:
git clone https://github.com/openai-on-aws/benchmarks-openai
pip install -r requirements.txt
export OPENAI_API_KEY=sk-... # your own key; not stored
export AWS_REGION=us-west-2 # plus your standard AWS credentials
python quality/quick_evals.py # accuracy + cost per correct answer
python quality/deepsearchqa/run_deepsearchqa.py # live-web agent trajectories
python quality/gdpval_eval.py # professional deliverables, rubric-judged
performance/run_all.sh # latency, both applications
用 50–100 个你自己的带有已知正确答案的任务替换,这些脚本会在你的账户上、你的领域中产生每个成功案例的成本数字。
每个 token 的价格是决策的一个输入,不是决策本身。在我们测试的配置中,通过成功结果归一化成本后,在准确率、token 效率和轨迹长度被纳入后,模型排名发生了变化。定价页也会变动,正如 2026 年 7 月的 GPT-5.6 降价所示。定义你的应用需要的结果和质量阈值,衡量成功和失败的全部成本,并在价格、模型或 workload 形态变化时重新运行评估。
要开始使用 Amazon Bedrock 上的 OpenAI 模型,请参阅 Amazon Bedrock 文档。要在你自己的任务上复现这些基准测试,请克隆 openai-on-aws/benchmarks-openai 并按照上一节的步骤操作。