同一任务跑5种模型组合,最贵与最便宜方案相差27倍;benchmark最低价模型反而产生最高账单;无基准最优解。
仅凭单一因素(零售价、基准测试分数、行业热度)来选模型,很少能预测出 agentic 开发的真实成本和质量。我有一个项目需要 agentic 开发生命周期,加上还有一些空闲周期,于是团队做了一个实验:在 GitHub Copilot 中,用相同的起始包(架构文档、技术设计文档、产品简介、初始待办列表、UX 设计和 mockup),分别跑五个不同的模型组合。每次运行都从待办列表中自主规划工作、实现其创建的每个任务,并追踪 AI 积分(AICs)的消耗——AICs 是 GitHub 对 Copilot 使用的计费单位。
五次运行都完成了各自规划的全部内容,但账单从最便宜到最贵相差 27 倍,而且基准网站评为单任务成本最低的模型,反而产生了本次实验中费用最高的运行。出人意料的是,我最初仅凭成本选出的领先组合,在加入代码质量评估后,排在了第二名之后。而最贵的顶级模型甚至没有产生最好的输出。
成本差距。五种模型组合运行相同的实验,全部完成了各自规划的内容。账单从 304 到 8,185 AICs 不等:差距达 27 倍,排除 Auto 实验后也有 6.4 倍。相同的工作、相同的完成标准,成本却天差地别。
基准测试衡量的是它们的场景,不是你的。Artificial Analysis 评为单任务成本最低的模型之一($0.43)却产生了本次实验中最贵的运行。基准测试回答的是通用场景;你的 prompt、上下文和工作流是特定的。在你自己的场景中验证成本和质量。
成本领先者在质量上排在第二名之后。最划算的正经运行(GPT-5.6 Sol + Terra,1,283 AICs)在成本和视觉输出上看起来是赢家,但代码质量评分却排在第二名之后(Grok 4.5,2,277 AICs):35 分中得了 18 分对 27 分。那些代码质量可能会在后续的返工和维护成本中找回来。
Auto 以放弃控制权换取折扣。Auto 运行是本次实验中成本最低、速度最快的(304 AICs,约 14 分钟),但其产出也是迄今为止最差的,评审分数和 linter(其他所有运行都是零错误,它却有 14 个)都证实了这一点。Auto 承诺最低费用加九折优惠,但你放弃了一切控制权,盲目信任供应商及其路由。这个九折优惠很可能让你多花 10% 的钱。
每次运行都从相同的包开始:架构文档、技术设计文档、产品简介、初始待办列表,以及 UX 设计和 mockup。每次运行都从新分支开始,issue 追踪存在本地文件中,这样追踪系统本身在所有运行中保持一致。
每次运行都以一个"拷问"环节开场:agent 在动笔之前先对包进行追问,以巩固其理解。架构方面的拷问在实验前已经完成,所以跨领域的问题(如并发、测试标准、平台选择)基本都已解决。剩下的是产品和功能的理解,以及每个功能特有的技术细节:字段长度、表单的验证规则,这类问题。经过这轮拷问,每次运行都写了一份规格说明,并将工作分解为实现任务。这一切都在一次会话中完成,以保持上下文的一致性和效率。这标志着规划阶段的结束。
实现阶段就是按照各自的任务清单推进,直到每项任务都被标记为完成——这是每次运行的完成标准。模型可以在阶段之间或实现中途切换,这就是组合的由来。我们在全程追踪 AICs 消耗,由手工记录或在每次会话结束时由测试工具自动报告。
团队成员分担了这些运行:Grok 和混合模型运行、Opus 5、GPT Sol + Terra,以及 Auto。
有五种组合进入了实验。推理努力(reasoning effort)按模型列出,因为它直接影响账单和产出。
混合运行原本计划是 Opus 做规划、Sonnet 做实现。中途我不小心切换到了 Gemini 3.5 Flash,并且过了好几次会话才注意到,这变成了一个意外的三个模型对比。哎呀。
Grok 运行赢得了一席之地:在我自己进行的 Ship Bench 对比中,Grok 4.5 已经以几分之一的价格取得了 Opus 级别的成绩,所以它全程以单一模型高强度运行所有任务。
Opus 5 运行用的是旗舰模型的最便宜档位:低强度,加上 100 万上下文窗口。
GPT 运行是在追逐 Artificial Analysis 的每任务成本数据以及对 GPT token 效率的行业热度:用 Sol 做规划,Terra 做实现。效率的热度确实应验了,至少在账单上是如此。
Auto 运行把模型选择权交给了供应商。Auto 承诺最低费用和九折优惠;我们想看看这个承诺实际上能带来什么。
先看表格,再看分析。成本按阶段分列;墙上时钟时间按记录为准(有一个如实记录的缺口)。运行结束后,我对每份产出都做了评审:用固定的工具链做静态分析,外加独立的评审者 Pass,按 7 个质量维度评分(满分 35),范围限定在实验要求的内容内。
Auto 最后跑且权重最低,所以尽管它是最便宜的一行,仍然作为表格的锚点。混合运行的墙上时钟时间没有被捕获。
GPT Sol + Terra(1,283 AICs,约 47 分钟)。最便宜的正经运行,也是迄今为止最快的;GPT 模型在整个过程中明显都快。它早期看起来是赢家:账单低,视觉效果在规划指令告诉它要遵守设计之后与设计一致(在那次修复之前,视觉效果落后于 Grok)。评审 Pass 就不那么客气了:35 分中得了 18 分,客户端逻辑集中在一个大组件中,整体架构单薄。便宜、快速、好看。代码需要更多规范,我们的 SDLC 通常通过在流程早期置入质量工具来强制执行这种规范。
Grok(2,277 AICs,约四小时)。成本第二名,质量第一名:评审得分 35 分中得 27 分,也是五种组合中架构最清晰的。它最严格地遵守了视觉设计,尤其是在更新后的规划指令就位之后。有两点值得注意。首先是感觉慢:tokens 的流速比通过 Grok Build 运行相同模型时要慢,尽管这类吞吐量数字很容易被提供商容量影响,而且可能差异很大。其次是暴露了一个流程缺口——我忘了启动 Docker:agents 应该在启动前确认其工具和环境。它的第一个动作是写了自己的 monorepo 启动脚本,这为一次超级遵守指令的运行奠定了基调。
Mixed(4,378 AICs)。意外的三模型运行。Opus 规划是本次实验中最贵的规划阶段(622 AICs;仅拷问环节就花了 350,而 Grok 的更长对话只花了 175)。在实现阶段,Sonnet 会话平均 789 AICs,Gemini Flash 是 348,不过会话不是等价的工作单位,而且强度设置不同,所以把这个数字当作方向性参考。运行的真正失败在流程上:工单从未链接回 UI 设计,视觉效果也偏离了,需要一次单独的 783 AICs 评审 Pass(未计入上方数字)才能拉回来。它还积累了最多的依赖面,扫描时有 11 个有漏洞的 npm 包,而其他运行除了都继承的那一个 CVE 之外,几乎没有别的。在评审中排名中游,35 分得 24 分,却是五种组合中代码库最大的。
Opus 5(8,185 AICs,约 127 分钟)。最贵的运行,费用几乎是第二名的两倍,也是基准表最没料到的:Artificial Analysis 评测 Opus 5 在低强度下是每任务最便宜的模型之一($0.43,尽管其零售价更高),这主要得益于输出效率。但在真实的 agentic 工作流中,配合 100 万上下文窗口,它烧掉的钱比任何其他运行都多;仅脚手架工单就花了 1,855 AICs。它也是唯一一个不能端到端 restore 的构建:它自己的 warnings-as-errors 策略把一个依赖漏洞警告升级成了构建错误,而且没有人跑完整的解决方案构建来捕获它。如果不算构建和 restore 的问题,评审得分与 Grok 持平,35 分得 27 分,而且它最接近设计稿,还不需要任何指令帮助,这说明了它的推理能力。但构建必须能工作。
Auto(304 AICs,约 14 分钟)。最便宜、最快,但也最弱:删除确认用的是通用浏览器对话框,14 个 lint 错误,而其他所有运行都是零错误,评审得分 35 分得 17 分。它确实完成了它规划的所有内容,这话值得一说。但它产生的东西根本不是你会发布的东西。
作为外部参考,以下是 Artificial Analysis 对这些模型的评测结果(Intelligence Index v4.1.1,2026 年 8 月检索)。这些是 API 列表价格基准,不是 Copilot 积分;单位不可换算,这也是要点之一。
基准测试用的是最大强度;我们的运行用的是中等强度。Auto 没有基准表条目,这本身就说明了一些问题。
有两点很突出。Opus 5 那一行是本次实验存在的理由:尽管零售价高昂,基准测试显示其每任务成本最低,但它却产生了我们最贵的运行。而 Terra,榜单上每任务最便宜的 $0.12,在 Artificial Analysis 自己的 GPT-5.6 分解中甚至偏离了价值前沿——后者发现 Sol 和 Luna 在每个强度级别上都领先于 Terra。最便宜不等于最有价值。基准测试衡量的是它们的场景;唯一重要的成本和质量数字,是你在你自己的场景中验证出来的。
验证你自己的假设。基准表把我们带到了候选名单,仅此而已。如果基准的场景是在公共仓库中修 bug,而你的场景是从设计包构建功能,这些数字是不会转移的。唯一重要的成本和质量数字,是来自你自己的流程、你自己的 prompt、你自己的代码库。
规范优于模型选择。每个正经的运行都完成了它们规划的所有内容。区分好结果和昂贵结果的,不是模型本身,而是围绕它的 agentic SDLC:在写代码之前先巩固产品理解,指令要真正承载设计意图,质量工具要足够早地捕获 agent 不会捕获的东西。有了这些,各种模型都能带你走向成功。账单和精致程度会有差异;但结果不一定有。
原型会轮转。今天的均衡型模型(Grok)、效率之王(GPT 系列)和一次性奇迹(Opus 5,实际上还有 Claude Fable 5)不会在下个季度继续持有这些头衔。我们这里跑的阵容,到某些读者看到这篇文章时就已经是遗产了。这才是真正的结论:养成自己评估的习惯,因为你很快又要再做一次。
基准能把你带到候选名单。自己跑出来的运行才能告诉你真相。