AREX Feed Article
Qwen 开源 Qwen-Image-2.1:一个 7B 模型统一图像生成与编辑,原生 RGBA、最多 10 张参考图
北京时间 9 月 20 日晚,阿里 Qwen 团队通过官方 X 账号 宣布图像模型 Qwen-Image-2.1 开放权重(open weights):一个模型同时承担文本生成图像与图像编辑,视觉生成部分 7B 参数,原生支持带透明通道的 RGBA 图层生成与编辑,编辑时最多可接受 10 张参考图。公告同时给出四个发布入口:、GitHub 仓库 、 与 ,Hugging Face 上的 同步运行。
团队在公告中称,这是 Qwen-Image 系列「最均衡、最具性价比」的图像生成模型,性能「超越多数闭源模型」。截至 9 月 21 日发稿前,该公告帖在 X 上累计约 57.2 万次浏览、约 3,900 个点赞。
32 层单流 DiT,文本与参考图共用 Qwen3-VL 8B 编码器
按的定位,Qwen-Image-2.1 要兼顾生成质量、推理效率与成本。它的视觉生成组件为 32 层单流 DiT(Single-Stream Diffusion Transformer)结构、共 7B 参数;文本编码器是 Qwen3-VL 8B 视觉语言模型,把文字指令和参考图编码进同一种表示。仓库文档给出的默认设置为 40 步去噪、原生 2K 分辨率,支持 7 种固定比例,从 1:1(2,048×2,048)到 16:9(2,752×1,536)。
Qwen 还随模型发布了两个基于 Qwen3.5-VL 9B 微调的提示词改写模型(PE-T2I 与 PE-I2I),分别对应文生图与编辑,把短提示词扩写成细节更充分的长描述。
RGBA 透明图层从专用模型并入统一模型
原生透明是官方列出的本版主要新增能力。2025 年 12 月,Qwen 曾发布专用模型 Qwen-Image-Layered 用于透明图像生成;2.1 版把这项能力并入统一模型,由提示词决定输出普通图像还是带透明通道的图像。官方推荐在提示词中写明「This is an RGBA image with transparency. …」的固定格式以获得最佳效果。
博客演示了三类用法:在保留透明背景的前提下修改主体表情;直接编辑透明图层内的文字,示例中「BLOOM」被替换为「Qwen-Image」;以及把普通 RGB 照片中的主体抠成带透明通道的 RGBA 图层,供后续设计合成复用。支撑这一能力的是仓库文档列出的 64 通道 RGBA 自编码器(VAE),空间压缩 16 倍,从机制上原生支持透明通道。
最多 10 张参考图,圈选、涂抹、蒙版三种局部标注
编辑能力上,官方列出四个改进方向:多参考图、局部编辑、保真度与任务覆盖。参考图上限为 10 张:官方示例中,6 张单人肖像合成一张合影;虚拟试穿把模特、服装、鞋、包、帽子 5 张输入组合成完整穿搭;室内设计用 10 张家具图生成整套排布。
局部编辑支持三种标注方式:画圆圈、手绘涂抹,以及「原图+独立蒙版」两张输入——最后一种让标注不遮挡原始画面。博客给的多区域示例用三个彩色圆圈一次完成三项修改:「移除蓝色圆圈中的金属手表,把红色圆圈中的头发改为黑色,将绿色圆圈区域换成灰色短袖亚麻睡衣」。
保真度方面,官方称模型在编辑时能更好地保留人脸特征,产品图则保住文字、纹理与形状。任务覆盖还包括把一张自拍扩展成全景图、把模特照片扩展成信息图、根据三视图角色参考生成完整分镜;连续多次局部编辑的结果可以串成简单动画,博客示例是一组「水豚版葫芦兄弟」。视觉质量上,官方称这一版在文字排印与人像光影上较前代有提升。
多图编辑提速:KV cache 跨去噪步骤复用
多图输入的推理加速来自官方所称的「混合粒度注意力」架构:文本(含系统前缀与编辑指令)使用 token(词元)级因果掩码,图像生成使用块级掩码。输入图像与编辑指令作为静态上下文,在第一步去噪时计算一次并缓存,之后所有步骤复用这份 KV cache(键值缓存);仓库文档称这能明显加快多条件图编辑并降低显存占用。调度器为 Flow Matching(流匹配),采用 Euler 离散调度与动态偏移。
Diffusers、ComfyUI 等 Day-0(发布当天)接入,权重采用 Qwen 研究许可
据 9 月 20 日的发布说明,多家推理与工作流框架当天完成适配:Diffusers 通过 QwenImage21Pipeline 支持生成与编辑(PR #14804);ComfyUI 原生支持,上线文生图与编辑两套示例工作流及兼容权重;vLLM-Omni 提供前缀 KV 缓存、CUDA Graph 解码、FP8 量化与多 GPU 并行;SGLang(PR #39983)和 LightX2V 也在同日适配名单中。ModelScope 侧基于 DiffSynth-Studio 提供模型下载、在线生成与 LoRA 训练;仓库还提到面向中国大陆用户的 wuli.art 免费入口,以及经 FlagOS 软件栈适配的 8 个芯片平台(含 T-Head zhenwu 与 Arm 平台的预构建权重)。
许可方面,团队在博客与仓库使用「open-source」表述、在公告中称「open weights」,权重文件附带的许可证为 Qwen Research License Agreement。
性能口径:自建基准上的 60.28 分
性能方面,官方给出的可核对依据是自建基准 Qwen-Image-Bench 的总分对比图:Qwen-Image-2.1 以 60.28 分在图中 29 个模型里排第七,前六名均为带锁标记的闭源模型——GPT Image 2.5 Sunburst(67.01)、GPT Image 2(64.69)、Grok Imagine 2.0(63.47)、Qwen Image 3 Pro(62.36)、Muse Image(62.34)、MAI Image 2.5 Pro(61.02);图表脚注注明闭源模型参数量未公开。图中 19 款闭源模型有 13 款分数低于 60.28,这是「超越多数闭源模型」一说的直接出处。图中同系列的 Qwen-Image 与 Qwen-Image-2512(均标注 20B 参数)分别得 49.23 与 52.06 分,均低于 7B 的新模型;80B 的 Hunyuan Image 3.0 得 50.81 分。
在官方博客、GitHub 仓库与 Hugging Face 模型卡公开的材料中,除这张自建基准对比图外没有附第三方评测。