GitHub Copilot Agent 多模型性能评测
GitHub 发布 Copilot agent 框架的性能基准测试,覆盖 20+ 模型,量化代码生成的 token 效率和精度。
GitHub 发布 Copilot agent 框架的性能基准测试,覆盖 20+ 模型,量化代码生成的 token 效率和精度。
模型提供原始智能,而 harness 决定了这种智能能被多高效地运用。GitHub Copilot agentic harness 是 GitHub Copilot SDK 中唯一的共享组件,为 GitHub Copilot CLI、GitHub Copilot app 和 Copilot code review 提供支持,同时也驱动 GitHub 与 Microsoft 旗下的众多体验。只要改进 harness,所有产品界面都能从中受益。
工具、上下文和工作流都由 harness 统一编排。对开发者来说,一个优秀的 harness 应当快速、节省 token,并且行为可预测。这正是 GitHub Copilot agentic harness 的设计目标。
本文将通过数据,展示 GitHub Copilot agentic harness 在各种 agentic 软件工程任务中的效率和性能。
我们结合公开基准测试和内部开发的基准测试,持续评估 GitHub Copilot agentic harness 的能力与效率。公开基准测试涵盖行业标准,而多个内部基准测试则源自 GitHub 和 Microsoft 内部的大型代码库。此外,我们还结合真实世界的指标和在线实验,确保既能了解 harness 在受控环境中的表现,也能掌握它在 agentic 问题解决和任务完成方面的实际影响。
为了评估 GitHub Copilot harness 与模型提供商 harness 的性能差异,我们会尽可能控制变量:使用相同的模型、相同的基准测试任务,并统一 context window、reasoning effort、工具选择和 MCP servers。
下面给出我们所跟踪基准测试中一部分项目的最新结果,涵盖四款领先模型:Claude Sonnet 4.6、Claude Opus 4.7、GPT‑5.4 和 GPT‑5.5。
在全文的对比中,我们将 GitHub Copilot CLI 与原生搭载这些模型的模型厂商 harness 进行比较:Sonnet 4.6 和 Opus 4.7 对应 Claude Code,GPT‑5.4 和 GPT‑5.5 对应 Codex CLI。
在模型和任务保持不变的情况下,多项基准测试结果显示,GitHub Copilot harness 的任务完成率与其他模型厂商 harness 相当,同时在大多数配置下消耗的 token 更少。
只有真正完成了任务,token 效率才有意义。
在固定模型和基准测试任务的前提下,GitHub Copilot agentic harness 在这些基准测试中的任务解决率与模型厂商 harness 相当。这意味着底层模型的全部潜力都能得到发挥,同时还具备多模型灵活性、token 效率以及记忆与上下文能力。
这些结果体现出双方在实际效果上基本持平。由于模型具有随机性,两个方向上的差异都处于正常方差范围内,因此不同 harness 的整体表现可以视为相当。
为了持续提升 GitHub Copilot agentic harness 的任务完成率和 token 效率,我们会定期针对各项基准测试展开全面分析。下面是 TerminalBench 2.0 的方差分析示例。它不仅展现了 GitHub Copilot 在任务完成率和 token 效率方面的优势,也体现出此类基准测试固有的多次运行结果差异。
图中的每个标记都代表 TerminalBench 2.0 上的一种 Agent 与模型配置。纵轴表示任务解决率,横轴表示单项任务的美元成本。每个数据点周围的阴影椭圆表示多次运行结果的 ±1σ 分布范围,用于展示各项配置在不同运行之间的波动幅度。
其中有三点尤为突出:
GitHub Copilot agentic harness 在我们评估的各种配置中,其任务完成率和单项任务成本与其他 Agent 相当或更优。几乎对于每一种模型,紫色的 Copilot 标记与使用相同模型的竞争方案,在两个坐标轴上的椭圆区域都会相互重叠——这些差异均处于多次运行的方差范围内。在完成率方面,Copilot 从未低于竞争方案;在成本方面,它也从未出现在竞争方案的右侧。
多次运行之间存在波动。我们对每一种 Agent 与模型组合至少运行了五次。椭圆表示这些运行结果的 1σ 分布范围:图中越紧凑的椭圆,意味着结果的可复现性越高;越宽的椭圆,则表示成本和任务完成率在不同运行之间的波动越大。
GitHub Copilot 模型选择带来的优势:图表呈现出一种真实的权衡关系。GPT 模型位于图表左侧,以最低成本实现了较高的任务解决率,性价比最佳。Claude Opus 位于右上方,以更高成本取得了最高的任务解决率。GitHub Copilot 同时提供这两类选择,因此你可以针对每项任务选择更高的效率,或追求极致质量。
GitHub Copilot agentic harness 支持 GPT、Claude、Gemini 和 MAI 系列中的 20 多款前沿模型,还允许你自带 key,接入开源模型和本地模型。你可以根据每项任务所需的能力和成本特征选择合适的模型,也可以交给 Auto model selection,在综合考虑任务意图和模型健康状态后自动选择,从而优化 token 效率。
多模型架构还解锁了模型厂商 harness 无法提供的 harness 级能力。例如,Rubber Duck 会使用跨模型家族的评审机制,让一个模型审查另一个模型的工作,从而获得超越任何单一模型独立产出的结果。
基准测试只是众多评估信号之一。我们一直在努力提升基准测试、真实使用指标和在线实验中的质量,同时尽可能高效地发挥每一个 token 的价值。
GitHub Copilot 在多种配置下使用更少 token,却能实现与领先模型厂商 harness 相当的任务解决率;与此同时,它还通过多模型架构避免将你绑定在某一种模型上。对开发者而言,这意味着你能以更低的 token 成本获得相近的任务完成效果,同时仍可选择最适合当前任务的模型。
请选择你喜欢的模型试用 GitHub Copilot,在每天处理的任务中比较不同方案,看看不同模型和 Agent 策略在你的环境中表现如何。
这些体验均由同一个 agentic harness 提供支持。我们还将继续提升它的质量、效率和灵活性。
为了尽可能保证对比过程可控且结果可复现,我们会让每个 Agent 在不同模型、任务和环境中使用对等的设置运行。
所有运行都设置了两小时的超时时间。所有 Agent 均以非交互式、单轮方式运行,禁用 web-tools,并允许使用全部工具。
TerminalBench2 分析:启用各 Agent 的默认设置,并将 reasoning effort 设置为 medium(例如,Claude Code 启用了 tool search,Copilot CLI 使用 github-mcp-server)。Codex 和 Claude Code 分别使用 Anthropic 和 OpenAI 的直接端点。为了确保结果完整可靠,任何数据缺失或基础设施相关的失败都会重新运行,直到全部 89 项 TerminalBench2 任务都产生结果。模型自身产生的错误会保留,不会从分析中排除。每个模型均进行了五次独立运行,而 Copilot 则在两个独立的评估批次中接受测试,以便分别与 Claude Code 和 Codex 进行比较。
全部基准测试:所有 Agent 与模型组合均统一使用相同的 context window 大小、相同的 prompt token 上限、reasoning effort(medium)和设置——不使用 tool search,也不使用 MCP servers,同时保留 harness 默认的内置工具。对于同一项基准测试,所有 Agent 的基础设施异常和网络访问影响均会被排除,以确保比较公平。为了降低多次运行差异对小型基准测试(少于 100 个实例)的影响,我们进行了五次独立运行,并报告得分最高的一次。所有指标均以 pass@1 呈现。由于采用了这些统一设置,结果会与公开提交的基准测试成绩有所不同;公开提交通常会使用更高的 reasoning effort 以及其他经过调优的设置。
CodeAI 和 GitHub Copilot Coding Agents 首席软件工程师
GitHub Copilot 合作伙伴架构师
一套实用的 GitHub Copilot 工作流,涵盖软件原型设计、规划、实现和审查,让你不必追逐每一个新出现的 AI 工具。
刚接触 GitHub Copilot app?了解如何创建项目、与 AI agents 协作、探索 canvases,并简化你的开发工作流。
Copilot 现在按照标示的 API 费率计费用量。对比直接访问模型,以及围绕模型提供的编码工作流、策略和 harness 能力。