主流 AI 编程工具实测排名:Claude Code 和 Codex 在 Terminal-Bench 打成平手(约 89%),各工具按场景各有优势(IDE 深度、并行能力、价格)。
原文首发于 dreaming.press。
如果只想要简短结论:在纯终端能力上,排名依次是 1)Claude Code、2)OpenAI Codex、3)Cursor、4)Meta Muse Code、5)Google Gemini CLI / Antigravity、6)Grok Build——其中 Claude Code(基于 Claude Opus 5)和 Codex(基于 GPT-5.6 Sol)在 Terminal-Bench 2.1 上接近到可以并列第一(据聚合方报告约为 89.1% vs 89.5%)。但这张单一排名是个陷阱:选哪个 agent 完全取决于任务类型,一旦按无人值守并行、IDE 深度或价格重新排序,顺序就会打乱。这是一份决策工具,不是排行榜。
Agent 运行模型 优势 需要注意
Claude Code Claude Opus 5 整体最优 harness; token 最贵($5/$25 每百万)
终端 + 子 agent
OpenAI Codex GPT-5.6 Sol 无人值守、隔离的 云优先;交互性较弱
并行云端运行
Cursor 多模型 IDE 原生,企业级 最强功能锁定在
(Grok 4.6, 多模型支持 Ultra 套餐($200/月)
Opus 5, GPT-5.6)
Meta Muse Code Muse Spark 1.2 性价比——接近前沿水平 仅次于 Opus 5;
且价格最低 最便宜档会用你的代码训练
Gemini CLI / Gemini 3.5 Flash Google 全栈 agent 独立 Gemini CLI 已于
Antigravity IDE,跨界面协同 2026/6/18 停服
Grok Build Grok 4.6 知识/法律推理, 终端使用能力明显较弱
长周期 agent
Coding agent 是指这个" harness"——即读取代码库、编辑文件、运行测试、迭代的 CLI、IDE 或云端循环。它与其底层模型不是同一回事,两者的排名会出现分歧。如果你想看模型层的排名,我们在最佳 LLM for coding 中单独做了排名。
自 2026 年 7 月底起,Claude Code 默认使用 Claude Opus 5,定价为每百万 token 输入 $5 / 输出 $25。它在所有中立终端基准测试中要么第一,要么并列第一——Terminal-Bench 2.1 上约为 89.1%,略低于 Codex 的约 89.5%,但大幅领先其他所有产品,这两者共同占据了前沿榜首。Claude Code 拿下综合冠军的原因并不是榜单上那零点几分的差距——而是 harness 本身:成熟的子 agent、深厚的工具和 MCP 生态、以及业内最可靠的多步终端循环。当任务是"住在我的代码库里把它搞定",这就是默认选择。
需要如实说明的是成本问题。Opus token 是这次盘点中最贵的,重度交互使用会让大多数独立开发者转向 Max $200/月的套餐来让成本合理。你是在为最好的循环付费,不是为最便宜的。如果你在 Claude Code 和 Anthropic 的另一个 agent 入口之间权衡,我们在 Claude Code vs Cowork 中做了详细对比。
如果说 Claude Code 是你坐在旁边的 agent,那 OpenAI Codex 就是你派出去的那个。它运行 GPT-5.6 Sol——该模型于 2026 年 7 月 9 日在 Codex 更新日志中宣布达到通用可用——Codex 将你的代码库克隆到隔离的云端沙箱中,读取代码库、编辑、运行测试,并返回带有可追溯终端日志的 diff。它的真正优势是并行云端执行:你可以同时排队多个任务,每个任务在独立沙箱中运行,拥有独立的 git 状态,让它们无人值守地运行数小时。
这是一种不同于结对编程的工作形态。对于独立创始人来说,这意味着睡前抛出三四个范围明确的任务单,第二天早上 review diff——"agent 不睡觉"的模式,但因为每次运行都相互隔离所以可以安全执行。Codex 在 Terminal-Bench 上略高的分数恰恰反映了这种可靠性:当没有人盯着循环时,断步骤更少。当价值在于吞吐量和隔离性而非对话式来回交互时,选 Codex。
Cursor 是模型无关的 IDE,在 2026 年 8 月它是最值得关注的选择,因为 SpaceXAI 正在收购它,并将 Grok 基于它做了联合训练。截至 2026 年 8 月 12 日,Grok 4.6 在其发布的同一天下午就以 live 模型形态内置于 Cursor 中,与 Opus 5 和 GPT-5.6 一同出现在模型选择器中。这种多模型灵活性——不离开编辑器就切换大脑——是 Cursor 的核心卖点,也是想要统一 IDE 但混合使用不同模型的团队最终落脚于此的原因。
需要注意的是打包方式:最强的 agent 功能的越来越被锁定在 Ultra 套餐中,价格为 $200/月,所以"完整功能 Cursor"的入门成本是真实存在的。对于个人开发者来说这很贵;对于获得融资的团队统一编辑器来说,这就是个零头。如果你的约束是"所有人用同一个 IDE,按任务选模型",Cursor 排第一。如果你已经在 Google 生态中,Google 的 Antigravity(见下方)是另一个认真的 agent-IDE 竞争者。
Meta Muse Code 于 2026 年 8 月 5 日以 beta 形式发布,运行 Muse Spark 1.2,是性价比之选,也是今年夏天的惊喜。它是终端原生 agent,形态与 Claude Code 和 Codex CLI 完全一致,具备持久后台 agent 和并行子 agent 技巧——但 token 价格只是零头。标准档为每百万 token $1.25 输入 / $4.25 输出,你的代码保持私有;贡献者档降至 $0.10 / $0.20,条件是授予 Meta 用你的数据训练的权限。
在 Meta 自行选取并运行的三个编程基准测试中,Muse Spark 1.2 仅次于 Claude Opus 5——这是厂商自己跑的,需要打折看待,但与独立早期评测将其定位在接近前沿的结果一致。有一点需要如实说明:以每个任务成本而非每 token 成本计算,与前沿的差距会缩小,因为稍弱的模型需要更多轮次。它仍然是运行具备真实能力 agent 的最低成本方案,私有档使其成为合法的默认试用选择。Muse 的开源权重兄弟版本也值得关注——参见 Meta Muse open-weight local agent model。
Google 的故事是一场迁移。独立 Gemini CLI 于 2026 年 6 月 18 日停服,被整合进 Antigravity CLI——一个基于 Go 的工具(agy),启动更快,并与 Antigravity 桌面 IDE、SDK 和企业档共享同一个 agent harness,所有默认使用 Gemini 3.5 Flash。如果你工作在 Google Cloud,Antigravity 的统一界面是在桌面、终端和 CI 上运行 agent 的最整洁方式。在这个引力场之外,它是一个扎实但不算领先的 harness,靠的是生态契合度而非原始终端得分。
Grok Build 运行 Grok 4.6,在 8 月 12 日发布时在 Artificial Analysis Intelligence Index 上得分 61——与 GPT-5.6 Sol 持平,仅以一分之差落后于 Claude Fable 5——每百万 token 只需 $2/$6,500K token 上下文,通过 Grok Build、Cursor、OpenRouter、Vercel 和 Cloudflare 提供。从纸面上看这是惊人的性价比。
但它在此榜单上排最后的原因如下:Grok 4.6 的知识工作组件接近领域顶尖,而其终端和软件工程组件则落后。它在 Harvey LAB 法律推理基准上给出了惊人的 15.8%,对比 GPT-5.6 Sol 的 2.5%,但在 coding agent 成也终端败也终端的那些具体任务上表现最弱。翻译一下:Grok Build 是一个出色的长周期推理和知识 agent,顺便写代码,而不是终端专家。对于法律科技、研究或预算有限的知识密集型 agent,它可能是你的首选。对于在 shell 里交付功能,它是价格很好但工具不对。
坐在旁边交互式工作:Claude Code。 fire-and-forget 并行运行:OpenAI Codex。团队统一 IDE 混合模型:Cursor。不牺牲太多前提下的最低账单:Meta Muse Code。深度集成 Google Cloud:Antigravity。知识和法律推理优于原始终端能力:Grok Build。在你决定之前,记得算上 token 账单——如果你在这些 harness 背后自托管模型,租用一块 H100/H200/B200 的成本是另外一半要算的账。