分析了从 AI 图像生成到可交付设计的完整工程管道,揭示了模型是简单的 20%,约束处理和规范生成才是关键的 80%。
如果你用过任何现代图像模型,就已经知道,它能把一张后院照片重新设计得美轮美奂。输入「把这个院子改造成现代日式庭院」,几秒钟后就能得到一张相当逼真的效果图。问题解决了,对吧?
还差得远。漂亮的图片只是问题中容易解决的 20%。真正困难的 80%——决定最终产物究竟是可用产品还是玩具的部分——是生成模型完全不了解的一切:这些植物能否在用户所在地的气候中存活,如何把一张非结构化照片转换为空间地图,以及如何输出一份承包商真正可以照着施工的结构化规格说明。
我想带你完整了解一款生产级 AI 景观设计工具背后的真实工程流程,因为它很好地展现了「能够生成内容的模型」与「真正可以交付的系统」之间存在多大差距。这里会以 Hadaa 作为具体案例,因为它是这个领域实现相对完整的产品之一,但其中的架构经验几乎适用于所有你可能构建的「生成式能力 + 现实约束」产品。
输入:1~14 张用手机拍摄的杂乱真实庭院照片。用户真正需要的输出:
只有第一项属于生成式视觉问题。其余几项,本质上都是披着风衣的结构化数据问题。这就是整件事最关键的洞察。
你无法约束或标注自己在空间层面并不理解的内容。因此,在任何「让它变漂亮」的步骤之前,系统都必须先把像素转换成结构:对场景进行分割(草坪、围栏、露台、现有树木、建筑结构),估算大致几何关系;如果输入了多张照片,还要将它们拼接成一张连贯的场地平面区域图。
这些都是不怎么光鲜的计算机视觉基础设施:图像分割、深度与一致性估计,以及把多张图片综合成统一的俯视空间理解。如果这一步做错了,下游所有环节都会继承错误。如果做对了,你就拥有了一块区域边界明确的画布,可以有意识地保留、编辑或替换特定区域,而不是任由模型在整个画面上产生幻觉。
如果你正在构建类似产品,一个很实际的结论是:遮罩和区域保留必须是一等功能,而不能事后补上。用户真正需要的是:「重新设计花坛,但房屋和泳池的位置必须原封不动。」只有阶段 1 产出了真实、可操作的区域信息,这种需求才有可能实现。
接下来才是生成步骤。系统根据结构化场景和风格 prompt,生成照片级真实的不同方案。现代基于 diffusion 的 image-to-image 模型非常擅长这件事;到了 2026 年,真实性基本已经成为一种解决得相当成熟的通用能力。
这里的工程重点并不是「生成结果能不能好看」,而是控制能力:能否遵守需要保留的遮罩,能否把修改限制在局部(把竹子换成棕榈树,同时不重新绘制房屋),以及能否生成一组彼此一致的图片(同一套设计覆盖 8 个相机视角,以及不同季节和夜间版本),而不是 8 张互不相关的图像。
一组图像之间的一致性,才是真正困难的子问题,而且它与一次性生成完全不是一回事。
大多数「AI 庭院设计」工具都会在这里悄无声息地失败,而真正有意思的工程工作也恰恰发生在这里。
生成模型根本不知道什么植物适合生长在哪里。对于一个位于 USDA zone 4 的庭院,它可能会在效果图中画上热带棕榈树,因为棕榈树看起来符合「繁茂花园」的要求,而模型优化的目标是视觉上的可信度,不是植物能否存活。九个月后,当所有植物都死掉时,用户才会发现问题。
解决这个问题并不是 prompt engineering——你不能只在 prompt 后面补一句「使用合适的植物」,然后就选择相信模型。它是一个叠加在生成流程之上的约束满足问题:
Hadaa 把这个系统称为它的「Biological Engine」。这也是竞争对手最难复制的部分——恰恰因为它不是对模型做一点微调,而是围绕生成核心额外挂载了一整套数据与规则子系统。
这是一个经典模式:真正的护城河不是模型,而是包裹在模型周围的领域约束。(他们对 11 款工具的拆解,也算是一份不错的地图,可以看出哪些工具具备这项能力,哪些没有。)
最后一公里,是把用户批准的效果图转换成真正可以施工的内容:一份用颜色区分的蓝图(区域、标注、路径宽度),以及一份工程量清单(每种植物需要多少株、每种材料需要多少)。
本质上,这是一个与阶段 2 方向相反的信息提取和布局生成问题——把视觉设计重新转换为结构化、可量化的数据。
这里同样隐藏着巨大的商业价值,因为专业人员真正能交给施工团队的,正是这类交付物。对于独立设计师而言,「这是一张漂亮的图片」和「这是两分钟内生成的蓝图、经过气候分区验证的种植指南,以及已经定价的 BOQ」之间的区别,就是销售周期按天计算,还是按分钟计算的区别。
这正是 Hadaa Pro Studio 的核心卖点,而它面向专业人士的功能拆解,基本上就是这个阶段的一份规格说明书。
因为原始 diffusion 模型只能提供阶段 2,除此之外什么都没有。要真正交付一款产品,你仍然必须构建:
第一列里的每一个 ❌ 都代表一个子系统,而不是一条 prompt。这就是为什么「给我一个 API key,我周末就能把它重做出来」会成为这个品类中著名的临终遗言。
阅读这类文章的大多数人,只是想重新设计自己的庭院,或者把相关工具用于专业工作。即使如此,工程视角依然可以为你提供选购标准:
如果你想研究一套真正运行中的完整流程,最快建立直觉的方法,就是把一张庭院照片交给这类工具处理,然后仔细检查它生成的种植指南和蓝图究竟包含什么——你可以从这些内容中直接感受到,一款工具真正构建了哪些阶段,又在哪些阶段只是做出了假象。
这个经验远不只适用于花园。在 2026 年的大多数「AI 完成 X」产品中,生成模型已经成为一种通用商品。真正持久的工程能力——也是护城河——是这样一层系统:它把生成过程约束在现实世界的真实条件之内,并输出结构化、可执行的结果。
在景观设计中,这一层包括空间理解、考虑气候条件的约束满足,以及规格生成。效果图只是演示起来最好看的部分。
如果你正在比较这个领域的工具,请根据那些不容易截成漂亮图片的部分来评价它们。
你对生成模型之上的约束层有什么看法?我很想知道你会如何以不同方式设计 Biological Engine——欢迎留言。
如需采取进一步措施,你可以考虑屏蔽此人和/或举报滥用行为。