阿里千问 9 月 20 日开源了新一代图像模型 Qwen-Image-2.1。它把文生图和图像编辑装进同一个模型,视觉生成部分只有 7B 参数(32 层 Single-Stream DiT),并原生支持透明图像的生成与编辑。在官方 Qwen-Image-Bench 公开评测里,它拿到 60.28 分排总分第 7:排在前面的 6 个模型(GPT Image 2.5 Sunburst 67.01、GPT Image 2 64.69、Grok Imagine 2.0 63.47、Qwen Image 3 Pro 62.36、Muse Image 62.34、MAI Image 2.5 Pro 61.02)全部是闭源模型,它是榜单上排名最高的开源权重模型。

榜单的参数量一行同样值得看:排在前面的闭源模型参数量标注在 10B 到 80B 一档,Qwen-Image-2.1 的 7B 是榜单头部规格最小的一档。对想在本地部署的开发者来说,这个参数量意味着消费级显卡就有机会跑起来。
效率是这次的主线
架构上,Qwen-Image-2.1 用混合粒度注意力处理多模态输入:系统前缀和编辑指令等文本部分走 Token 级因果掩码,图像生成部分走 Chunk 级掩码;同时引入前缀 KV Cache 复用,把输入图像和编辑指令当作静态上下文,在第一步就完成预计算和缓存。官方给出的效果是:多图输入场景的推理耗时几乎不随参考图数量增长。

从官方曲线看,Qwen-Image-2.1 在 10 张参考图输入时推理耗时约 1.59 秒(2K 分辨率),Pro 版约 6.31 秒;作为对比,曲线里的闭源模型 Qwen-Image-3.0 在 3 张参考图时已经到 79.5 秒,3.0 Pro 版 112.5 秒。多图参考编辑的等待时间从分钟级压到秒级,这类差距会直接改变工作流里"敢不敢用 AI 改图"的决策。
原生透明图像
透明图像能力来自 2025 年 12 月的 Qwen-Image-Layered,这次被整合进统一模型。模型根据提示词自动决定输出普通图像还是带透明通道的 RGBA 图像,一个模型同时覆盖透明图生成、透明层编辑和照片抠图三类任务。

编辑同样作用于透明图层:可以在保留透明背景的前提下修改主体表情,也能修改透明图层里的文字,官方示例把贴纸上的 BLOOM 改成了 Qwen-Image。对真实照片,输入 RGB 图像可以输出带透明通道的 RGBA 主体图层,省掉去抠图工具单独处理的步骤。

编辑能力围绕多、局、保、全四个方向
多图:最多支持 10 张参考图输入。官方示例演示了把 6 张人像合成一张多人合照、模特加衣服鞋子包帽共 5 张图合成穿搭效果、10 张家居图生成室内布置。

局部:支持三种编辑区域指定方式,彩色圆圈标注(官方示例一次圈三个区域,分别改手表、发色和衣服)、白色涂抹标记区域、原图加独立掩码两张图输入。掩码方式不覆盖原图信息,适合精细控制。
保真:人像编辑强化面部特征保留,商品编辑强调文字、纹理与形态一致,两类场景官方都给了前后对比样例。
全:覆盖全景图生成(一张自拍照扩展成可环视的全景)、信息图生成(一张模特照片扩成内容丰富的信息图)、分镜生成(人物三视图出完整分镜)。

上手路径
diffusers 已合并支持,安装 GitHub 最新版后用 QwenImage21Pipeline 加载:
import torch
from diffusers import QwenImage21Pipeline
pipe = QwenImage21Pipeline.from_pretrained(
"Qwen/Qwen-Image-2.1", torch_dtype=torch.bfloat16
).to("cuda")
image = pipe(
prompt="A neon shop sign that reads \"QWEN IMAGE 2.1\", rainy night",
width=2048, height=2048,
num_inference_steps=40,
).images[0]生成透明图像有推荐的提示词格式,开头声明 RGBA 图像和透明背景即可。原生分辨率覆盖 1:1 的 2048×2048 到 16:9 的 2752×1536。显存紧张可以开 enable_model_cpu_offload。ComfyUI 在发布当天就上线了支持,不想写代码可以直接在 ComfyUI 里跑。
官方还同天放出了两个提示词改写配套模型 PE-T2I 和 PE-I2I,基于 Qwen3.5-VL 9B 微调,把任意语言的简短需求改写成详细英文提示词并给出推荐长宽比,相当于给主模型配了一个自动写提示词的前置模块。
一个需要留意的细节:协议变了
上一代 Qwen-Image 用 Apache 2.0 协议(该仓库在 HuggingFace 累计下载已超 30 万次),Qwen-Image-2.1 改成了 Qwen Research License:权重开放下载,但用途仅限研究和评估,商用需要向千问单独申请授权。7B 的低部署门槛加上研究协议,组合起来读是"技术上跑得动,商用前先谈授权"。个人玩模型和做评测不受影响,接产品线的团队需要多一步法务评估。
来源:
- 官方博客:https://qwen.ai/blog?id=qwen-image-2.1
- HuggingFace 仓库:https://huggingface.co/Qwen/Qwen-Image-2.1
- ComfyUI 支持页:https://comfy.org/zh-CN/qwen-image-2.1