METR 研究数据打破直觉——开发者用 AI 工具实际变慢,却自我感觉良好。对如何有效利用 AI 工具有重要启示。
速度数字会吸引所有关注,但我认为真正重要的发现是知觉差距。我们感觉更快是因为 AI 处理了无聊的部分——样板代码、语法、那些感觉像工作但实际难度不在那里的东西。同时,难的部分变得更难了:理解 AI 改了什么,验证它是否正确,维持对你没写过的代码的心智模型。
Simon Willison——Datasette 背后的人,也是我认识的最多产的 AI 辅助开发者之一——写过让我印象深刻的话:
我不再对我的项目能做什么以及它们如何工作有清晰的心智模型。
这是一个用 AI 辅助构建了 80 多个工具的开发者。如果连他都在为心智模型而苦恼,也许问题不在经验水平。
这是我现在的思考方式:
AI 之前: 思考 → 编写 → 测试 → 调试
使用 AI: 描述 → 审核 → 验证 → 调试 AI → 调试你的理解
编写这一步变便宜了。其他一切都变贵了。而「审查你没写过的代码」在认知上比「编写你理解的代码」更难——任何做过代码审查的人都知道这一点。
AI 把我们都变成了杰夫·贝佐斯——自动化了简单的工作,留下了所有难的决定。——Steve Yegge
METR 研究本质上证实了我们很多人一直在感受但不想承认的东西:AI 编码工具不会节省时间。最好的情况下,它们改变了你的注意力去向。最坏的情况下,它们制造了生产力的假象,同时认知负担实际上增加了。
我停止了优化速度。相反,我开始问:我的注意力去了哪里?
在我碰任何 AI 工具之前,我用纯文本写下——我想要什么,为什么想要,「完成」是什么样子。不是为了 AI。是为了我自己。这需要 5-10 分钟,是我一整天做的最有影响力的事,因为它迫使我在生成前思考。
Kent Beck 称这为「增强编码」和「虚无编码」的区别。后者是希望 AI 给你可工作的代码。前者是在 AI 写代码之前知道可工作的代码是什么样子。
我曾经认为代码审查是在真正工作之后做的繁琐任务。现在它就是真正的工作。StrongDM 的团队把这个做到了极端——他们的「Dark Factory」设置零人工代码审查。所有投资都进入了测试、工具和模拟。人类定义什么是正确的。机器做其他一切。
我还没做到,但方向很清楚:我的价值不在编写代码。在于定义我特定环境下「正确」的含义。
更多的代码行数不是更多的生产力。更多的 PR 不是更多的生产力。Harness 2025 调查发现 67% 的开发者花在调试 AI 生成代码上的时间比自己写代码要多。如果是你,更快地生成更多代码是在让事情变糟,而不是变好。
我现在关心的指标:我的注意力中有多少去了只有我才能做的决定?架构选择、面向用户的权衡、「我们是否应该甚至构建这个」——这是 AI 做不了的东西。其他一切,我想自动化不是因为它更快,而是因为它为难题释放了心智带宽。
如果 METR 研究是对的——如果 AI 工具实际上不会为经验丰富的开发者在熟悉的代码库上节省时间——那么 AI 编码的价值主张就不是「10 倍生产力」。它是更微妙的东西:
如果你有纪律实际去做,把你的注意力花在更高影响力的工作上的能力。
这比「更快地编写代码」难卖得多。它要求你知道高影响力的工作是什么样子,并抵抗看 AI 在 3 秒内生成 200 行代码的多巴胺刺激。
我还没想清楚。有些时候我还是会抓住自己在虚无编码,假装输出是好的因为它能编译。METR 研究的知觉差距不仅仅是关于他们的参与者——是关于我们所有人。
但至少现在,当我用 AI 感到有生产力时,我会停下来问:我实际上是生产力强,还是只是感觉那样?
I Use AI Coding Tools Every Day. Here's What I've Stopped Trusting Them With.
The AI Coding Workflow That Actually Works: Separate Planning from Execution
The Real Cost of Running AI Coding Agents (It's Not What You Think)
有些评论可能仅对登录访问者可见。登录以查看所有评论。
进一步的操作,你可能考虑屏蔽此人和/或举报滥用。