Qwen-Image-2.1是7B参数扩散Transformer,支持文生图、多参考编辑和原生RGBA透明度,权重开源但商业使用需单独授权。
Alibaba Qwen 团队发布了 Qwen-Image-2.1,一款统一的文生图与图像编辑模型。其视觉生成组件包含 7B 参数,分布在 32 个单流 DiT 层中。一个 checkpoint 同时覆盖文生图、多参考编辑、局部编辑和透明 RGBA 输出。
能否部署?可以,用于研究和评估。Day 0 支持 Diffusers、ComfyUI、vLLM-Omni、SGLang 和 LightX2V。商业部署需要向 Qwen 单独申请授权。
原始 Qwen-Image 于 2025 年 8 月发布,是 20B 规模模型,采用 Apache 2.0 许可证。编辑能力此前位于独立的 Qwen-Image-Edit checkpoint 中。Qwen-Image-2.1 将两项任务合并到一个模型中,规模缩小至原来的三分之一左右。Qwen 团队称其为 Qwen-Image 系列中平衡性和性价比最优的模型。这里有一个容量规划需要注意的重点:7B 这个数字仅涵盖扩散 Transformer。完整流水线还会加载一个 8B 的 Qwen3-VL 编码器。
GitHub 仓库列出了 4 个组件:
Transformer:32 层、7B 参数、单流设计,采用 block-causal attention(块级因果注意力)。
Text encoder(文本编码器):Qwen3-VL 8B,将文本指令和条件图像编码为统一表示。
VAE:64 通道 RGBA 自编码器,16 倍空间压缩比,原生支持透明度。
Scheduler(调度器):Flow Matching,Euler 离散调度,动态偏移(dynamic shifting)。
注意力掩码是速度提升的关键。文本 token 使用 token 级因果掩码,图像 token 在每张图像内使用 chunk 级双向掩码。Qwen 将此称为混合粒度注意力(mixed-granularity attention)。条件前缀位于带噪声的 latent 之前,因此永远不会attend 到它。其 key 和 value 在去噪步骤中保持固定。模型在第一步计算一次文本和输入图像,之后每一步复用该前缀 KV 缓存。节省量随参考图像数量增长,这解释了多图像场景下的速度优势。
原生透明支持:从文本生成 RGBA 图像、编辑透明层、从照片中提取主体。Qwen 推荐使用固定 prompt 模板来生成透明输出。
多参考编辑:接受最多 10 张参考图像。README 示例包括:从 6 张肖像合成一张合影、从 5 张参考生成一套穿搭。
局部控制:编辑可以针对特定区域,使用圆形、涂鸦标注或独立蒙版。对人物和产品的身份特征予以保留。
原生 2K:默认 2048 × 2048,支持 7 种宽高比,最大到 2752 × 1536。
美学表现:在字体排版、人像光线和细节方面均有提升。Qwen 重点提到了全景图、信息图、故事板和虚拟试穿。
研究团队在 Qwen-Image-Bench(Qwen 内部基准)上对比各模型。Qwen-Image-2.1 在该图表上综合得分 60.28,超越了 59.82 的 Nano Banana 2.0 以及所有列出的开源权重模型。32B 开源模型 FLUX 2 Max 为 55.33。有 6 个闭源模型得分更高,其中第一名 GPT Image 2.5 Sunburst 为 67.01。
安装 PyTorch 2.4.0 或更高版本、transformers 5.17 或更高版本、从源码安装 Diffusers、accelerate 和 pillow。然后:
import torch
from diffusers import QwenImage21Pipeline
pipe = QwenImage21Pipeline.from_pretrained(
"Qwen/Qwen-Image-2.1", torch_dtype=torch.bfloat16
).to("cuda")
image = pipe(
prompt="A neon shop sign that reads \"QWEN IMAGE 2.1\", rainy night",
num_inference_steps=40,
).images[0]
image.save("t2i.png")
传入 image= 和 1 张或多张参考图即可用同一 pipeline 进行编辑。在较小显存的 GPU 上,pipe.enable_model_cpu_offload() 可降低内存压力。
推理服务方面,vLLM-Omni 提供 FP8 量化、前缀 KV 缓存、CUDA Graph 解码和 tensor 并行。SGLang 提供 Cache-DiT、CUDA graphs、多 GPU 并行和组件卸载。ComfyUI 提供原生节点和转换后的权重。除 NVIDIA 外,发布版本还覆盖 AMD Radeon GPU(通过 ROCm)以及 8 家芯片平台的 FlagOS。
Qwen 团队还发布了 2 个 prompt 重写模型,是对 Qwen3.5-VL 9B 进行微调的 checkpoint,分别用于文生图和编辑。它们将短 prompt 扩展为详细 prompt,并可选择宽高比。
Qwen-Image-2.1 以一个 7B DiT 搭配 Qwen3-VL 8B 编码器统一了生成和编辑能力。
原生 RGBA 输出和最多 10 张参考图像来自单一 checkpoint。
前缀 KV 缓存复用每次生成只计算一次文本和参考图像。
在 Qwen 自有基准上得分 60.28,位列所有列出的开源权重模型之首。
Qwen Research License 禁止未经单独协议的商业使用。