Qwen 发布开放权重的 Qwen-Image-2.1-Turbo,在同一 7B 架构上将图像生成与编辑的去噪步骤从默认 40 步降至 8 步。开发者也可选择托管 API。
人工智能
Alibaba 的 Qwen 团队发布了 Qwen-Image-2.1-Turbo,这是其开放权重模型 Qwen-Image-2.1 的加速版 checkpoint。它只需 8 个去噪步骤即可生成和编辑图像,而基础模型默认需要 40 步。对开发者来说,这意味着在相同的 7B 架构上,去噪步数降至原来的五分之一,同时还可以选择托管 API。
规模:视觉生成器有 7B 参数,搭配 Qwen3-VL 8B text encoder。
运行环境:通过 Diffusers,以 BF16 精度在 CUDA GPU 上运行。Qwen 未公布 Turbo 的最低显存要求。Unsloth 估算,基础模型使用 GGUF 时需要 11 GB 显存,使用 INT8/FP8 时需要 24 GB。
性能:保留 Qwen-Image-2.1 的 2K 输出能力和全部编辑功能,将去噪步数从 40 步减少到 8 步。
最佳表现:基础模型 Qwen-Image-2.1 在 Qwen-Image-Bench 上得分 60.28,是 Qwen 公布的开放权重模型中的最高分。
核心优势:一个开放 checkpoint 即可完成 8 步 2K 图像生成和编辑。
主要限制:仅采用研究许可,商业用途的自行部署需要另行获得授权。
Qwen-Image-2.1-Turbo 是 Alibaba Qwen 团队推出的图像生成与编辑 checkpoint,只需 8 步即可完成采样。它基于 Qwen-Image-2.1 构建,保留了相同的 7B 视觉生成架构,可以在 Diffusers 中通过 QwenImage21Pipeline 直接加载。
checkpoint 内置了推荐的 8 步采样调度。生成时默认使用 CFG=1。Prefix KV caching 会在各个去噪步骤之间复用文本和参考图像的上下文。
底层架构是一个拥有 32 层、7B 参数的单流 DiT,采用 block-causal attention。文本 token 使用 token 级 causal mask,图像则使用 chunk 级 bidirectional mask。
Text encoder:Qwen3-VL 8B 同时编码指令和条件图像。
VAE:一个 64 通道的 RGBA autoencoder,空间压缩倍率为 16 倍,支持原生透明度。
Scheduler:采用 Flow Matching,结合 Euler 离散调度和 dynamic shifting。
这种 attention 设计使 prefix caching 成为可能。输入图像和文本只在第一步计算一次,之后每一步都复用这份缓存。在总共只有 8 步的情况下,缓存的 prefix 可以覆盖条件处理的大部分计算开销。
Turbo 的 model card 展示了 8 类示例,包括人像、人体姿态、透明图像、文字排版与海报,以及 UI 布局。编辑示例包括单图转换、多参考图组合,以及使用 4 张图像进行室内场景组合。基础模型最多支持 10 张参考图,还可以通过圈选、涂画标注或 mask 进行局部编辑。
环境配置需要从源码安装 Diffusers,并安装 transformers>=5.17.0。该 checkpoint 需要 Diffusers PR #14950,其中新增了由 pipeline 配置采样 sigmas 的能力。
import torch
from diffusers import QwenImage21Pipeline
pipe = QwenImage21Pipeline.from_pretrained(
"Qwen/Qwen-Image-2.1-Turbo", dtype=torch.bfloat16
).to("cuda")
image = pipe(
prompt="A ceramic teapot on a wooden table, soft window light",
width=2048, height=2048, use_kv_cache=True,
).images[0]
进行编辑时,传入 image=input_image,并提供指令 prompt。支持的预设尺寸从 2048×2048 的正方形,到 16:9 的 2752×1536。
这里有一点需要注意:仅设置 num_inference_steps 并不会覆盖已保存的采样调度。只有显式传入 sigmas 参数才能覆盖它,而且 Qwen 表示其他调度方案尚未经过测试。
Alibaba Cloud Model Studio 现已托管 Turbo 和 Pro 两个版本。在大多数地区,qwen-image-2.1-turbo 每张图像收费 0.1 元人民币,请求速率上限为 120 RPM。qwen-image-2.1-pro 每张图像收费 0.25 元人民币,上限为 20 RPM。Turbo 的单张图像费用是 Pro 的五分之二,也就是便宜 2.5 倍,允许的请求速率则是 Pro 的 6 倍。
| 特性 | Qwen-Image-2.1-Turbo | Qwen-Image-2.1 | Z-Image-Turbo | FLUX.2 klein 9B |
|---|---|---|---|---|
| 所属机构 | Alibaba Qwen | Alibaba Qwen | Alibaba Tongyi-MAI | Black Forest Labs |
| 生成器规模 | 7B | 7B | 6B | 9B |
| Text encoder | Qwen3-VL 8B | Qwen3-VL 8B | 未披露 | Qwen3 8B |
| 默认步数 | 8 | 40 | 8 NFEs | 4 |
| 编辑能力 | 支持,多参考图 | 支持,最多 10 张参考图 | 不支持,另有独立 Edit 模型 | 支持,多参考图 |
| 透明 RGBA 输出 | 支持 | 支持 | 未披露 | 未披露 |
| 原生分辨率 | 2K(2048×2048) | 2K(2048×2048) | 示例为 1024×1024 | 示例为 1024×1024 |
| 硬件参考 | 未披露 | GGUF 需要 11 GB / FP8 需要 24 GB(Unsloth 估算) | 可在 16 GB 显存中运行 | 约 29 GB 显存,RTX 4090+ |
| 许可 | Qwen Research License | Qwen Research License | Apache 2.0 | FLUX Non-Commercial |
| Qwen-Image-Bench | 未披露 | 60.28(厂商公布) | 未披露 | 未披露 |
| 托管 API | 每张图像 0.1 元人民币 | Pro:每张图像 0.25 元人民币 | 未披露 | BFL API |
Qwen-Image-2.1-Turbo 在相同的 7B 架构上,将去噪步数从 40 步减少到 8 步。
一个 checkpoint 即可处理 2K 文生图、多参考图编辑和透明 RGBA 输出。
API 每张图像收费 0.1 元人民币,比 Pro 便宜 2.5 倍。
模型权重采用研究许可,因此商业用途的自行部署需要另行获得授权。
目前还没有针对 Turbo 的专门 benchmark;基础模型 Qwen-Image-2.1 在 Qwen-Image-Bench 上得分为 60.28。
欢迎查看 ModelScope 页面、Hugging Face 页面,以及 Pro API 和 Turbo API。所有功劳都归于该项目的研究人员。也欢迎在 Twitter 上关注我们,别忘了加入我们拥有超过 15 万成员的 ML SubReddit,并订阅我们的 Newsletter。等等!你用 Telegram 吗?现在也可以在 Telegram 上加入我们。
Asif Razzaq 是 Marktechpost AI Media Inc. 的 CEO。作为一位富有远见的创业者和工程师,Asif 致力于利用人工智能的潜力造福社会。他最近的项目是推出人工智能媒体平台 Marktechpost。该平台以深入报道 machine learning 和 deep learning 新闻而见长,内容既保持技术上的严谨,也能让广泛的读者群体轻松理解。平台每月浏览量超过 200 万,体现了它在读者中的受欢迎程度。