实证研究揭示开发者使用 AI 工具存在显著认知偏差——自觉效率提升 20%,实际测量反而慢了 19%,对工具选型和使用方式有直接指导意义。
隐藏的代码审查与调试开销
AI 工具让开发者觉得自己快了 20%。然而研究人员实际测量后发现,他们反而慢了 19%。再读一遍。
这不是四舍五入造成的误差。感知与现实之间相差整整 39 个百分点,而这个行业里没有人愿意讨论这件事。
METR 的研究采用了随机对照试验。不是问卷调查,不是博客文章,也不是厂商赞助的基准测试,而是一项严谨的实验。
研究人员邀请了经验丰富的开源贡献者,让他们在自己的代码仓库中完成任务。自己的代码,自己早已了如指掌的项目。
一半任务使用 AI 编程助手完成,另一半不使用。研究开始前,开发者预计 AI 能让自己快 24%;研究结束后,他们仍然认为 AI 让自己快了大约 20%。但秒表显示,他们实际上慢了 19%。
真正让我感到不安的是:如果现在问大多数开发者,AI 工具是否提升了他们的生产力,他们会回答「是」。我大概也会这么回答。
这正是陷阱所在。这些工具让人感觉自己很高效:自动补全不断触发,代码随即出现,你一直在向前推进。但「手上一直在动」和「真正取得进展」是两回事。
→ 审查和修复 AI 生成代码所花的时间,也要算
→ 输出错误后反复调整 prompt 所花的时间,也要算
→ 调试那些并非由你编写的隐蔽问题所花的时间,也要算
→ 评估建议引发的上下文切换成本,也要算
这些事情在发生时,都不会让人意识到自己「变慢了」。它们给人的感觉更像是在协作,但数据给出了相反的结论。
这才是最应该让你害怕的部分。数十亿美元的 AI 工具投资,依据竟然是……开发者感受调查。🙃
「87% 的游戏开发者已经在工作流中使用 AI Agent」,或者「87% 的开发者每天都在使用 AI 编程工具」。很好。老板盯着时,开发者还会报告说会议很有用呢。自我报告的生产力,可信度也就比占星术高一点。
METR 的研究是少数真正尝试衡量这件事的研究之一,而这件事恰恰是所有人都声称自己早已知道答案的。结果却与流行叙事完全相反。
我不是说 AI 编程工具毫无用处。我自己也在用。但我已经不再因为它们生成文本很快,就想当然地认为它们为我节省了时间。
这不是反对 AI 的论点,而是主张诚实面对事实。
如果 AI 工具确实对你有帮助,那很好。但你应该用比直觉更可靠的方法来验证这一点。记录自己完成相似任务实际需要的时间。留意那些本来 10 分钟就能写完、最后却花了 30 分钟与生成代码纠缠的情况。
令人不适的事实是:速度与速度感完全是两回事。一个能快速生成代码、却也能快速生成错误代码的工具,并不是生产力工具,而是一种极具迷惑性的干扰。🎭
真正值得担忧的,并不是 AI 工具效率不高,而是我们会在「它们效率很高」这一错误假设之上,对工程组织做出根本性改变,并且从未停下来质疑这个假设。
我们正在根据生产力提升的预期招聘员工、规划人员编制,并作出 sprint 承诺。而少数直接研究这个问题的学术研究之一,却非常明确地发现:所谓的生产力提升并不存在。
无论你处于 AI 热潮分歧的哪一边,这个事实都应该让你警觉。数据不在乎你的感受。显然,你的感受也不在乎数据。
所以,我真正想知道的是:你是否实际衡量过 AI 工具有没有为你节省时间,还是你也只凭感觉行事?
部分评论可能仅对已登录的访客可见。登录后即可查看全部评论。
如需采取进一步措施,你可以考虑屏蔽此人和/或举报滥用行为。