提出一套可重复的AI图像模型评估框架,包含可读文本渲染等关键指标。对于开发或评估图像生成工具的开发者有实践价值。
AI 图像模型用一个吸引人的样本很容易评判,但作为生产工具却异常难以评估。一个有用的测试需要可重复的输入、明确的通过/失败标准,以及不止一次的尝试。
本文描述了三个常见任务的小型基准测试:
在图像内渲染可读的文本,
不失去身份特征的情况下结合多个 reference,以及
在不重新构建整体的情况下进行局部编辑。
这些测试中我使用了 PixMind 中的 Nano Banana Pro workflow。相同的测试结构可以应用于其他图像模型,因此对模型选择而非单纯的 prompt 实验很有用。
"制作一个漂亮的产品海报"这样的 prompt 隐藏了大多数失败模式。模型可以选择简单的布局、避免小文字、改变产品,或以看起来合理但实际错误的方式解决歧义。
更好的评估方式是固定关键变量:
必须出现的确切文案,
必须保持可识别的 reference,
关键对象的位置,
请求的编辑边界,
宽高比和输出大小,以及
允许的尝试次数。
我用相同的 prompt 对每个案例运行三次。我不会在计分前悄悄修复拼写错误或在另一个编辑器中合成结果。这样可以暴露失败之处,并帮助区分可靠的 workflow 与运气好的样本。
第一个案例是一个虚构的发布海报。它包含一个标题、一个副标题、三个功能标签和一个号召性用语。重点不是获奖的排版。重点是模型是否能够保持层级结构并复现提供的文案。
Create a vertical 4:5 launch poster for a fictional productivity app.
Use a clean editorial grid with generous spacing.
Render this copy exactly:
Headline: TURN IDEAS INTO ACTION
Subtitle: A focused workspace for creative teams
Feature labels: PLAN / CREATE / REVIEW
CTA: START YOUR FIRST PROJECT
Use a deep navy background, warm white type, and one lime accent.
Do not add any other words, logos, badges, or watermarks.
Keep every line fully visible and leave safe margins around the text.
我根据五个检查项对输出进行评分:
每个必需的字符串都存在,
拼写和标点符号匹配,
视觉层级遵循请求的顺序,
没有出现虚构的文本,以及
所有文案在正常观看尺寸下都保持可读。
"不要添加任何其他单词"这个指令很重要。许多精致的生成失败是因为它们发明了标签、装饰性的小文案或类似标志的字形。
对于多语言测试,我重复 prompt,用一个非英文副标题替代整个海报的翻译。在一个组合中混合脚本对于营销资产来说是一个更具挑战性和现实的测试。
第二个案例使用三个具有不同职责的 reference:
reference A 定义产品,
reference B 定义人物或角色,
reference C 定义构图和光照。
prompt 应该为每个 reference 明确分配一个角色。仅说"使用这些 reference"会迫使模型猜测哪些属性重要。
Build a 16:9 product hero image.
Reference A is the exact product reference. Preserve its silhouette,
materials, color, button placement, and visible branding.
Reference B is the exact person reference. Preserve facial identity,
hair, age, and wardrobe colors.
Reference C is a layout reference only. Follow its camera angle,
negative space, and soft side lighting, but do not copy its objects.
Place the person on the left holding the product naturally.
Keep the right third uncluttered for headline text.
Use a restrained studio background with no extra accessories.
我将身份与风格分开比较。结果可以看起来连贯,同时仍然改变产品的几何形状或角色的脸部。我的检查清单包括:
产品几何形状和控制,
品牌颜色和材料,
脸部和头发的一致性,
从 reference C 请求的构图,以及
没有意外从布局 reference 借用的对象。
这也揭示了添加 reference 是改善控制还是增加 prompt 冲突。如果结果恶化,我会简化任务:首先固定产品和人物,然后在第二步请求布局。
第三个案例从最强的海报结果开始,并请求一个狭窄的更改。
Edit only the call-to-action button.
Change its fill from lime to coral and replace its text with:
TRY THE WORKFLOW
Preserve every other element exactly: headline, subtitle, feature labels,
font style, object positions, background, lighting, crop, and aspect ratio.
Do not regenerate or reinterpret unchanged regions.
按钮编辑很容易。真正的测试是不相关的区域是否保持稳定。我比较编辑前后的完整大小图像,并注意任何变化:
脸部或产品形状,
编辑区域外的文本,
间距和对齐,
裁剪和相机位置。
创建更漂亮图像但改变标题的局部编辑仍然是失败的编辑。在生产中,可预测性通常比意外重新设计更有价值。
一个简单的表格就足够了:
保留失败的尝试。删除它们会产生幸存者偏差,让每个模型看起来都比实际更可靠。
我还记录完整的 prompt、reference 顺序、模型/版本、宽高比、分辨率和日期。模型行为可能会变化,几个月前有效的 prompt 可能不会产生相同的结果。
告诉模型每个 reference 控制什么。"Reference A 控制产品身份"比"受 A 启发"更可操作。
不变量细节必须在每次尝试中存活:确切的文案、产品几何形状、人物身份和编辑边界。风格、情绪和装饰是偏好。将不变量放在首位并具体说明。
"不要添加任何其他单词"优于"保持整洁"。"不要从布局 reference 借用对象"优于"保持准确性"。
当一个 prompt 要求身份、排版、布局、叙事和复杂编辑时,失败就变得难以诊断。将 workflow 分为生成、选择和有界精化。
在缩略图中看起来正确的文本在全尺寸时可能包含损坏的字符。相反,微小的装饰性缺陷在社交帖子中可能不重要。在它将被使用的上下文中对结果进行评分。
最佳模型是任务相关的。对于情绪板,多样性可能比确切的文本更重要。对于产品发布图像,一个改变的按钮或虚构的标签会使资产失效。
根据最昂贵的可能失败进行选择:
对于海报、菜单、信息图表和类似 UI 的图形,使用关注文本的评估;
对于目录图像和营销变体,优先考虑 reference 保真度;
当需要精化批准的构图时,优先考虑编辑稳定性;
在生产前探索方向时,优先考虑迭代速度。
这个基准不会将图像质量简化为单一分数。它使权衡变得可见。一个模型在结构化排版上可能表现出色,但在多个 reference 上可能不太可预测,或者在身份一致性上强大但在编辑过程中容易产生全局变化。
我的生产序列是:
定义可交付物及其不可协商的细节,
以深思熟虑的顺序上传 reference,
为每个 reference 分配一个明确的角色,
生成三个受控的尝试,
用相同的检查清单对所有尝试进行评分,
为有界编辑选择一个结果,
比较改变和未改变的区域,以及
保存 prompt、设置和最终资产。
如需更详细的 prompt 模式演练,请参阅扩展的 Nano Banana Pro 图像指南。
核心思想很简单:像评估生产系统而非作品集一样评估图像模型。一个可重复的测试能够揭示模型在哪里节省时间,在哪里需要更紧凑的 prompt,以及在哪里不同的工具是更安全的选择。