顶级coding agent在SWE-bench Verified得分50-60%,但真实场景代码模糊、无测试、规则分散,实际表现远低于基准分。harness是让模型可靠工作的完整配套环境,而非模型本身。

在深入主题之前,先介绍3个必知的术语:
Harness(工具链):"套在AI模型上的全套马具",不是模型本身,而是让模型可靠运行的一整套"环境",包括指令文件、验证系统、进度记录系统等
Capability Gap(能力差距):模型"基准测试分数"与"实际表现"之间的差距
Verification Gap(验证差距):Agent"自信程度"与"实际正确性"之间的差距
打个比方:AI模型是"大脑",harness是让大脑能够真正动手做事的"身体+工具+规则"
2025年底,SWE-bench Verified上最强的coding agent得分约为50-60%。听起来还不错,但这个数字来自"精心挑选的任务"——有清晰的描述、有现成的测试用例。
一旦你把真实工作交给它,规格模糊、没有测试、业务规则散落在代码库的各个角落,分数就会进一步下滑。
你满怀信心地交付任务,agent运行20分钟后说"完成了",但你一看代码:它加了功能但把测试搞坏了、改了一个bug但产生了新bug,甚至根本不是你要的东西。
遇到这种情况,大多数人觉得是"模型不够强,换个更贵的试试"。
但在掏钱之前,试着想想:问题可能根本不在模型。
Anthropic做了一个非常清晰的对照实验:同一个prompt("创建一个2D复古游戏编辑器")、同一个模型(Opus 4.5),运行两次。
第一次:裸奔,没有任何辅助,20分钟,$9,游戏的主要功能无法使用。
第二次:完整的harness(planner + generator + evaluator三个agent),6小时,$200,游戏可以正常运行。
模型没变,Opus 4.5还是Opus 4.5。改变的是"马具"(tack)[2]。
OpenAI说得更直白:Codex在拥有良好harness的仓库中,从"不可靠"变成"可靠",不是"略有改善",而是"质的飞跃"[1]。
失败模式只有几种:
规格模糊——"添加搜索功能"几乎毫无意义。搜什么?全文搜索还是结构化搜索?需要分页吗?agent只能猜测,猜对是运气,猜错就是比一开始就明确需求贵几倍返工。
未成文的惯例——全队都用SQLAlchemy 2.0,但agent按默认设置写成1.x。"所有API必须经过OAuth 2.0"这条规则只存在于你和3个月前那条Slack消息里,agent不知道。不是不想遵守,是从来没看过。
环境不完整——agent在pip install error和Node版本冲突上烧掉context,而不是做实际工作。
没有验证手段——没有测试、没有lint,agent写完代码"感觉能用"就宣布完成。Anthropic还发现了"context anxiety"现象:当agent感觉context快满时,它会急着结束、跳过验证、选简单方案而不是正确方案。
状态跨session丢失——每个新session都从零开始,超过30分钟的任务失败率飙升。
很多人在说"harness"这个词,但大多数人的意思只是"prompt文件"——而prompt文件不等于harness。
定义清晰的harness由5个子系统组成[3]:
核心原则:只要不是model weights,就是harness,而harness决定了"模型的能力被真正利用了多少"。
一个团队用GPT-4o开发一个TypeScript + React应用(约20,000行代码),经过4个阶段:
4轮,模型没换,成功率从20%到接近100%。你没换模型,换的是harness。
当东西坏了,不要先换模型,先检查harness。
每一次失败都是信号,说明harness有结构性的缺陷,找到它然后修复。不要只是说"模型不够强"。
而一个AGENTS.md文件,可能比升级到更贵的模型更有效——这不是开玩笑。
我认为这是AI coding领域最重要的"思维模式转折点",它把问题从"哪个模型更强"变成"哪个harness更好"。
因为数据很清楚:同一个模型,在不同环境下,结果可以天差地别。
如果你用coding agent觉得"它不够强",在换模型之前,先问自己:"我的harness5个子系统都全了吗?"
你有没有遇到过agent说"完成了"但实际上没完成的问题?那时候你是通过换模型还是调整harness来解决的?评论区可以分享。
[1] OpenAI. "Harness Engineering: leveraging Codex in an agent-first world". 2026. https://openai.com/index/harness-engineering/
[2] Anthropic. "Effective harnesses for long-running agents". 2026. https://www.anthropic.com/engineering/effective-harnesses-for-long-running-agents
[3] Learn Harness Engineering, Lecture 01-02. 2026. https://github.com/walkinglabs/learn-harness-engineering
本文分析来源:OpenAI、Anthropic和walkinglabs/learn-harness-engineering,数据截至2026年8月23日。Nokka