文章基于METR、OpenAI、DORA和斯坦福研究,检验Agent编程替代初级工程师的四个可证伪条件,对AI编程能力边界有量化参考。
我读遍了每一个主流模型的发布。每次发布都会附带一个编程能力数值。
数值在涨。所有人都得出了同一个结论:初级工程师完了。
我认为这个结论的得出方式本身就是错的。人们从基准测试分数直接跳到了劳动力市场的结果,中间所有步骤都跳过了。
所以换一种方式来。不问"智能体是否会取代初级工程师",我想问的是:要使这成为现实,哪些条件必须为真?然后用现有最佳证据逐一检验。
一共有四个条件。其中三个尚未满足。第四个才是真正值得担心的,因为它不需要前三个条件同时成立。
目前最权威的衡量标准是 METR 的时间跨度研究。他们让人类专家在真实软件任务上计时,然后找出模型达到 50% 成功率的任务长度。
主要结论是:从 2019 年到 2025 年,这个时间跨度大约每七个月翻一番。METR 更新的时间跨度 1.1 将任务套件扩展了 34%,并将时长八小时以上的任务数量翻倍。对 2024 至 2026 年窗口的独立解读表明,此后翻倍速度还在加快。当前排行榜显示,前沿模型的时间跨度已达到小时级别。
听起来结论已定。但读一读他们的方法论,定论就站不住脚了。
两点很重要:
第一,50% 不是一个可以用于组建团队的标准。Kwa 等人也报告了 80% 水平的数据,而任意时刻它都比 50% 那条线短得多。他们的数据显示,前沿系统在人类四分钟内完成的任务上接近完美,而在人类需要四小时以上的任务上成功率不到 10%。
第二,也是几乎没人引用的部分:METR 明确指出其任务是刻意设计为自包含且表述清晰的。他们自己的表述是:两小时任务指的是没有任何前置上下文的人能在两小时内完成的,而不是熟悉代码库的资深工程师能完成的。
这恰恰是错误的任务形态。初级工程师入职前六个月几乎全部是上下文获取。这个服务归谁管、为什么存在那个抽象、该问谁。基准测试衡量的恰恰是工作中被剥离了最难部分的那一块。
2026 年 2 月,OpenAI 停止报告 SWE-bench Verified 并建议其他人也这样做。
他们的理由值得完整阅读,但两点发现尤为突出。他们审计了数据集的 27.6%,发现被审计问题中至少 59.4% 的测试用例存在缺陷,会拒绝功能正确的解决方案。他们还发现了污染问题:前沿模型能够复现完全一致的金标准补丁和问题细节,说明存在训练数据泄露。
最先进水平在六个月内从 74.9% 上升到 80.9%。OpenAI 提出的问题是:剩余的失败究竟是模型能力上限还是数据集本身的问题。答案主要是后者。
换一个更难、更少污染的测试集,分数就会断崖式下跌。SWE-bench Pro 就是为此构建的,而前沿模型在它上面的表现远低于发布公告中宣传的 Verified 数字。Terminal-Bench 和长期演化基准等更新的测试套件也是出于同样原因在构建。
我要谨慎一点。这不是说"基准测试毫无用处"。范围更窄、也更致命:具体这个被用了两年来说明初级工程师已过时数字,是由创建它的实验室公开停用的,原因恰恰让这个数字比现实看起来更好。
这个条件我认为被忽视得最严重,但它拥有最清晰的实验证据。
METR 对 16 名经验丰富的开源开发者开展了随机对照试验,在他们自己的代码仓库中处理 246 个真实任务。AI 使用与否随机决定。全程录屏。真实工作。
开发者预测会提速 24%。事后他们估计自己快了 20%。实际上他们慢了 19%。
两点需要说明,因为我希望你能信任这篇文章的其余部分。当时的工具是 2025 年初的版本。样本量小且特定:经验丰富的开发者在他们非常熟悉的成熟代码库上工作。这不是一份通用的生产力评估报告,METR 也没有这样声称。
但感知差距是那个持久不变的发现。人们在测量之下对自己生产力方向的判断都错了。
更广泛的数据也指向同一方向。Stack Overflow 2025 年对超过 49000 名开发者的调查发现,84% 在使用或计划使用 AI 工具,而 46% 主动不信任输出的准确性,相比之下只有 33% 信任。只有 3% 报告高度信任。在资深开发者中,高度不信任达到 20%。
Google 的 DORA 研究调查了约 5000 名专业人士,发现 90% 在工作中使用 AI,80% 以上认为 AI 提升了他们的生产力,而 30% 报告对 AI 生成的代码几乎不信任。DORA 的吞吐量发现比上一年有所改善。交付稳定性没有。他们的结论是:AI 是一个放大器——它放大了组织原本的特质。
综合来看。生成变便宜了。验证没有。审查能力现在是瓶颈,而审查能力是资深工程师的时间。
这是令人不安的部分。
条件一到三描述的是替代是否可行。条件四描述的是企业是否会尝试这样做。这是两个不同的问题,而且第二个已经有了答案。
斯坦福数字经济实验室追踪 ADP 工资数据,覆盖约六分之一的美国劳动者。他们的"Canaries"研究发现,在 AI 影响最显著的职位(包括软件开发)中,22 至 25 岁员工的就业与同职位较年长员工出现了急剧分化。截至 2025 年 7 月的数据,缺口为 15%。截至 2026 年 6 月,缺口已达 19%。
实时仪表盘显示调整是通过减少招聘而不是裁员来实现的。没有人被解雇。门正在关上。
修订版论文提出的机制是这一切中最有趣的发现。就业下降发生在依赖编码化知识的职位——即可以通过文档和标准化流程学习的知识。就业上升则出现在依赖隐性知识的职位——即通过实践、指导和反复接触真实情境获得的知识。
斯坦福谨慎地指出这些是描述性模式而非因果估计。要认真对待这一点。
但如果这个机制成立,注意它暗示了什么。编码化知识是初级工程师入职时带来的。隐性知识是初级工程师应该通过在监督下做编码化工作直到隐性部分沉淀来获取的。
我们正在自动化师徒制,同时保留对学徒制产物的要求。
智能体编程并没有在取代初级工程师。它在取代我们过去交给初级工程师的任务,这是不同的事情,而且后果更糟。
瓶颈从来不在生成。瓶颈在验证、在上下文、在判断,而我们拥有的所有测量都表明,前沿模型在这三者上恰恰最薄弱。
与此同时,招聘决策正基于创建这些数字的实验室已经公开停用的基准测试分数做出。
三年后看起来聪明的公司是那些在做无聊实验的公司:继续招聘初级工程师,入职第一天就给他们配智能体,然后测量他们是否比前一届更快地达到资深判断力。我猜会的,而且会快很多。没有人资助那样的研究,因为它不会产生财报上的数字。
我宁愿可证伪而不是聪明。以下是我在观察的:
一个 80% 可靠性的时间跨度,在有前置上下文的任务(而非自包含任务)上能覆盖完整工作日。
在前沿模型在一个无污染、私有构建的长期任务基准上超过 60%。
METR 试验的复现,实验中测量时间和感知时间指向同一方向。
在 AI 采用率保持不变的情况下,DORA 交付稳定性连续两年下降。
斯坦福 22 至 25 岁就业缺口在 AI 影响分数持续上升的同时收窄。
如果其中三个成为现实,我会写一篇观点相反的文章并链接到本文。
METR 的主要时间跨度是 50% 成功率的零上下文任务;初级工程师两者都不满足。
OpenAI 在发现大多数被审计失败子集存在缺陷测试后停用了 SWE-bench Verified。
生成变便宜了,验证没有;资深审查时间现在是真正的瓶颈。
斯坦福数据显示,受 AI 影响的 22 至 25 岁员工就业缺口达 19%,由招聘冻结驱动。
我们在自动化师徒制,同时仍然要求学徒制的产物。
Asif Razzaq 是 Marktechpost Media Inc. 的 CEO。作为一位有远见的企业家和工程师,Asif 致力于利用人工智能的潜力为社会公益服务。他最近的举措是推出了一个人工智能媒体平台 Marktechpost,该平台以深入报道机器学习和深度学习新闻著称,既具技术深度又易于广泛读者理解。该平台每月浏览量超过 200 万次,显示出其在受众中的受欢迎程度。