作者系统对比了主流编程 Agent 背后的模型性能,发现 GPT-5.6 Sol 与 Claude Opus 5 仅差 0.4 个百分点,同时价格正在大幅下探,真正的差异在于项目配置和验证流程。
几周前的一个晚上,我坐下来认真想了想是不是该换个编程 Agent。新出的基准测试分数、刚调整的价格,还有那种隐隐的感觉——好像所有人都在用比我手里更好的东西。
研究的结果出乎我的意料。在 Terminal-Bench 2.1 上,GPT-5.6 Sol 得分 89.5%,Claude Opus 5 满血模式得分 89.1%。这两是当下最常用的两个编程 Agent 背后的默认模型,它们只差 0.4 个百分点。与此同时 Opus 5 以前辈一半的价格发布,而 OpenAI 两周前把其中层模型最多砍了 80%。模型趋同了,价格也在崩塌,而且几乎同步发生。
于是我关掉了那些对比标签页,之后一直在思考:我的实际产出到底是从哪里来的。让人不舒服的答案是:近期的差异大部分根本不是来自模型本身,而是来自我围绕它搭建的那一整套配置。
我在每个项目里都维护一份指令文件——规范、要跑什么、不要碰什么。那些文件写得好的周,Agent 就好用;那些文件过时了的周,Agent 就会自信地做上个月的"正确"事情。
验证环节也是同样的道理。我为 Agent 配置做过的最大改进,不是升级模型,而是让测试运行变成强制环节——让 Agent 在我看到结果之前先检查自己的代码。一个更弱的模型但跑了测试,比一个更强的模型但不跑测试,结果要好得多,而且差距明显。基准测试看不到这一点,因为基准测试自带测试框架——它们只测量模型在独立任务上的表现。你的代码库,那个四分钟的测试套件、那个没写在任何地方的部署步骤,是另一种地形。
我最清晰的案例:一个 Agent 一直通过重新引入项目刻意放弃的模式来"修复"任务——每次都很自信,因为放弃它的原因只存在于我脑子里,Agent 根本读不到。再好的模型升级也解决不了这个问题;模型在它能看到的范围内没有任何错误。把约束写到规范文件里就解决了,第一次尝试之后就解决了。失败不是因为智能不够,而是因为我从来没告诉它这件我期望它知道的事。
这才是我一直不愿承认的事:两个开发者用同一个 Agent、同一个模型,拿到的东西已经完全不相似了。一个只是敲个提示词然后祈祷的人,和一个维护规范文件、接好测试钩子、精心筛选 Agent 能看到什么的人——这之间的差距,现在比任意两个前沿模型之间的差距还要大。
2024 年,工具选择解释了大部分差异。2026 年靠的是配置纪律,这就不那么好听了,因为你没法通过换产品来解决。写这话的人是我——我自己的规范文件在最后翻开看的时候,旧得令人尴尬。
如果我排个优先级,对我来说值得投入的部分依次是:验证循环第一,成文的规范第二,让 Agent 在独立 worktree 里工作以便低成本犯错第三,裁剪进上下文的内容最后。你的排序可能不同,但如果"选哪个模型"能进前三,我会很惊讶。
如果只能保留一个,那就是验证循环,而且优势明显。让 Agent 在我查看之前先跑自己的测试,今年对我的日常工作影响比任何模型发布都大——不是因为它能捕获所有错误,而是因为它改变了我注意力的去向。我不再审查代码能不能跑,而是审查代码是不是在做对的事,这是人类唯一真正更擅长的事情。
我没有换。不是出于忠诚——模型足够接近,切换成本会超过任何差异,这正是趋同分数和价格战的含义。模型会继续互相半个百分点地跳跃式超越。但它们周围的东西会积累:每一个钩子、规范文件、验证循环,在明年插入任何模型时都会继续产生回报。
如果你见过相反的情况——一个任务里单独换模型、配置不变,却产生了真正的差异——我真诚地想听听。那是我思维中需要的反例。
研究和起草过程有 AI 协助;所有测试、观点和最终修改均为本人独立完成。