2025年vibe coding只是「描述→生成→迭代」,一年后Claude Code已能自主导航仓库、编辑多文件、运行测试并提交commit;核心问题转向:Agent构建的代码在什么条件下才能安全投入生产。
当"vibe coding"这个词在 2025 年进入软件行业的词汇库时,它描述的是一个令人意外地简单的循环。
描述你想要的结果。让模型生成代码。试试看。不断提示,直到结果令你满意。
这个词本身很轻松。但这个转变不是。
一年之后,模型不再在聊天窗口里等待下一条指令。Claude Code 可以在仓库中导航、编辑多个文件、运行命令、测试结果,并提交变更。Codex 应用可以承担长时间运行的任务、并行工作,并把一个 diff 交给开发者审查。
现在,prompt 启动的是一个执行循环。
这比prompt驱动的代码生成要大得多。它也暴露了一个更难的问题:在任何人应该信任这个结果能上生产之前,需要满足什么条件?
三种看起来相似但实际不同的模式
"vibe coding"这个术语已经变得足够宽泛,掩盖了三种不同的工作方式。
Prompt 驱动的生成从一个请求和迭代反馈开始。系统生成代码或一个小应用。成功通常意味着演示的流程能正常工作。
Agentic coding 添加了一个仓库、工具和一个更长的任务视野。系统可以规划、编辑、运行命令、测试、检查失败,并继续工作。
生产工程添加了一个团队拥有这个发布所需的管理控制和证据。它在 prompt 开始之前就启动了,并在 agent 说任务完成之后继续。
这些模式可以使用相同的模型。改变的是围绕它的操作契约。
Vibe coding 是一种交互风格。Agentic coding 是一种系统能力。生产工程是一种组织责任。
把它们当作同义词,会让一次成功的 agent 运行看起来像是一个发布决策。但它不是。

工具改变了类别
第一代 AI 编程工具帮助开发者打字。当前这一代在行动。
一个 agent 可以安装依赖、修改接口、更新调用方、运行测试套件、检查失败,并重试。它可以做出一系列技术决策并观察后果。
这个执行循环是为什么 AI 生成的代码和人类编写的代码之间的旧区分变得越来越没有意义的原因。一个单独的变更可能包含模型输出、人类编辑、生成的测试、复制的模式,以及第二个 agent 的审查。
实际的单元不再是作者身份。而是团队正在考虑发布的那个变更。
这很重要,因为一个变更可能在技术上是连贯的,但对周围的产品来说仍然是错误的。仓库给 agent 提供了大量的实现上下文。它不会自动包含每一个客户期望、运营依赖、安全边界或必须保持稳定的未文档化行为。
当实现变得更便宜时,更多的想法变成了变更。
这是一个真实的生产力提升。但每一个额外的变更仍然需要意图、上下文、审查、安全、验证和所有权。生成五个看似合理的实现,不会带来五倍的理解其后果的能力。
在 2026 年 6 月由 GitLab 委托、The Harris Poll 执行的调查中,85% 的 1528 名开发者和技术买家同意 AI 已经将瓶颈从写代码转移到了审查和验证上。
调查记录的是感知而非交付遥测,所以它不是普遍效应的证明。但它确实表明,采用这些工具的团队感受到了向验证和治理转移的压力。
稀缺资源不再仅仅是产生候选变更的能力。而是能够阐明应该发生什么、提供 agent 无法推断的上下文、以及决定哪些证据足够强大到可以发布的能力。
"能工作"是一个狭窄的声明
一个能工作的结果是有价值的。它可能意味着应用加载了、请求的流程工作了一次、或者 agent 选择的测试通过了。
生产环境会问更广泛的问题:
实现是否匹配真实的产品意图?
它是否遵循了 prompt 中没有的架构和安全约束?
它是否正确地与私有系统集成?
被修改文件之外的哪些现有行为可能受到影响?
什么没有被测试或检查?
谁拥有剩余的不确定性?
Claude Code 和 Codex 减少了实现和调查所需的努力。它们不会把这些问题压缩成一次绿色的测试运行。
2025 年,生产差距看起来像是生成质量的限制。2026 年,有能力的 agent 表明,更深的差距是生成周围的交付系统。
一个成功的任务仍然可能产生一个糟糕的发布
考虑一个说明性的案例。
一个团队让 agent 替换一个服务中的认证中间件。agent 更新了接口、迁移了已知的调用方、添加了测试,并通过了对仓库的检查。针对分配的任务,结果看起来是完整的。
发布后,一个内部管理流程失败了,因为它依赖于旧中间件的一个未文档化的错误响应。这个被破坏的行为位于 agent 使用的文件和检查之外。
Agent 完成了分配的任务。交付系统未能描述必须保持稳定的完整行为。
这就是生产边界。Agent 执行是根据任务来评判的。发布必须根据变更可能影响的产品行为和运营依赖来评判。

专业知识变得更有价值
Agent 越有能力,清晰的判断力就越有价值。
Anthropic 关于 agentic coding 的研究发现了一个反复出现的劳动分工:人们在做什么的规划决策上做了大部分工作,而 Claude 在如何做的执行决策上做了更多。领域专业知识帮助人们给出更好的方向,并在 agent 误解任务时进行恢复。
Agent 可以消除大量的实现摩擦。这增加了理解问题、系统和后果的人的影响力。
有价值的开发者不仅仅是打字最快的人。而是能够将一个模糊的请求转化为精确任务的人,能够识别一个看似合理的实现何时违反了一个重要约束的人,以及能够请求测试真实风险的证据的人。
变得更重要五项责任
工程负责人应该停止将 agent 监督仅仅视为一个升级了的代码审查问题。这是一个发布问责问题。
随着 agent 变得越来越有能力,五项责任变得更重要:
明确意图。 在实现开始之前定义行为、边界和验收标准。
管理上下文。 维护 agent 需要的仓库说明、架构决策、产品约束和运营知识。
限定执行。 决定 agent 可以访问哪些文件、工具、网络、凭证和环境。
要求证据。 要求相关的构建、测试、审查和检查,包括一份关于什么没有运行的清晰记录。
承担结果。 将发布决策保留在一个理解剩余不确定性的有责任的人手中。
这不是从自动化的后退。这是自动化如何变得可用于关键工作的方式。
Agent 的采用不应该仅仅用完成的任务或接受的代码来衡量。更强的衡量标准是,更快的执行是否与更清晰的意图、独立证据和明确的归属相匹配。
Vibe coding 成长了,因为工具成长了。
出于同样的原因,生产变得更难了。
Prompt 可以启动实现。它无法拥有什么能够发布。
This article is adapted from Vibe Coding Grew Up. Production Got Harder. on the Early blog, which includes the full source list and Part 2 of the series.