Sourcegraph MCP 与 Claude Sonnet 组合在大规模代码任务上超越高端模型,成本仅为一半。展示 agent 的最佳实践配置和成本优化方案。
在九个旨在评估 agent 在大型代码库中的有效性的 CodeScaleBench 任务上,配备 Sourcegraph MCP server 的 Claude Sonnet 4.6 击败了 Fable 5,在九项中赢得六项,且每单位质量的成本约为一半。
在来自 CodeScaleBench 的九个发现密集型任务上——这是 Sourcegraph 针对大型多仓库代码库中的编码 agent 的基准——配备 Sourcegraph MCP server 且磁盘上没有源代码的 Claude Sonnet 4.6 得分为 0.698。Claude Fable 5 在本地检出整个仓库直接读取,没有任何检索,得分为 0.568,且每单位质量的成本几乎是两倍。配备该工具的更便宜的模型在九项任务中赢得六项。
Fable 5 是 Anthropic 的 Mythos 类中首个广泛可用的模型,这是 Opus 之上的层级,发布时在大多数公开基准上取得了最先进的成绩,包括 Cursor 和 Cognition 编码评估。这就是配备 Sourcegraph 的更便宜、更快的 Sonnet 4.6 在这项工作中超越的模型,在跨越庞大代码库查找正确代码是主要工作的任务上。
需要说明的是,这是九个任务,而不是完整的 CodeScaleBench。Fable 5 的访问权限在发布后数天内被限制,所以这九个是在该窗口关闭前完成有效 Fable 运行的。将该结果视为早期信号,而不是已确定的基准。
Sonnet 4.6 with Sourcegraph 磁盘上没有源代码,通过搜索、符号解析和引用跟踪来访问代码库。Fable 5 在本地检出整个仓库并直接读取。更便宜的模型在得分和成本上都领先,且差距在跨仓库查找正确代码是困难部分的任务上表现最明显。
差距不是均匀分布在九项任务中的。它集中在需要跨仓库查找符号实际使用位置的任务上,其中漏洞追踪和跨组织依赖跟踪占了大部分。两种设置都已解决的任务,比如配置追踪或清晰的迁移,排名接近顶部并平手,因为在已经得分很高的任务上没有提升的空间。在某个跨组织依赖任务上,进行完整本地检出的前沿模型表现更好,这说明该比较测量的是真实差异,而不是人为倾向。
结果探索器并排放置任何任务的运行结果,即配备 Sourcegraph 的更便宜模型和进行本地检出的前沿模型,各自包括完整的 prompt、对话和每个 tool call,这样你可以看到一个运行找到了另一个运行从未到达的文件的地方。
打开结果探索器 →
对于任何在预算内部署 agent 的人来说,实际意义在于:具有良好代码检索能力的更便宜、更快的模型击败了没有这种能力的更昂贵前沿模型,至少在该基准构建的跨仓库工作上是如此。停止有效的地方,在需要深度单文件推理而非导航的任务上,是值得进一步测量的。如果你正在构建或评估真实代码库上的 agent 工具,我很乐意聊天!你可以通过 stephanie.jarmak@sourcegraph.com 联系我。
解锁你的组织。更快地交付。
有了 Sourcegraph,企业级代码理解平台。