Qwen-Image-2.1 开源:7B 一个模型搞定文生图、编辑和透明素材

Qwen-Image-2.1 开源:7B 一个模型搞定文生图、编辑和透明素材

SketchTo 团队2026年9月22日8 分钟阅读

2026 年 9 月 20 日,阿里通义千问团队开源了 Qwen-Image-2.1。这次发布的关键词是"合并":一个视觉生成部分仅 7B 参数的模型,同时承担了文生图、指令式图像编辑,以及千问图像主线系列首次原生支持的透明(RGBA)图像生成与编辑。此前,千问的图像能力分散在多个专用模型里;2.1 把三者收进同一个权重文件,而且 ComfyUI 已经提供了原生工作流。

在动手之前有一个必须知道的细节:这套权重采用 Qwen Research License(千问研究许可),默认只允许非商业用途。如果你是研究者、ComfyUI 玩家,或者想尝试贴纸与素材工作流的设计师,这没有影响;但如果你打算把它做进产品,就需要向千问单独申请商业授权。

下面是这次发布实际包含的内容、新能力的原理,以及当前已经有文档支持的三种上手方式。

要点速览

  • 一体模型:Qwen-Image-2.1 用一个模型完成文生图和图像编辑,视觉生成部分为 7B 参数、32 层 Single-Stream DiT 结构。
  • 原生透明:可以直接按提示词生成带透明通道的图像、编辑透明图层内容,还能把普通照片中的主体抠成 RGBA 素材——2025 年 12 月发布的 Qwen-Image-Layered 的能力被并入了这个统一模型。
  • 更强的编辑控制:单次任务最多 10 张参考图,支持圈选、涂抹、独立掩码三种局部编辑方式。
  • 三种已文档化的上手路径:官方在线 Demo、带 2K 输出与透明通道支持的 ComfyUI 原生工作流、diffusers 的 QwenImage21Pipeline
  • 许可限制:开放权重不等于无限制使用——商用需要与千问另行签约。

示意图:三个专用千问图像模型合并为一个统一模型——文生图、编辑、透明图层汇聚成 Qwen-Image-2.1

Qwen-Image-2.1 把生成、编辑,以及 2025 年 12 月 Layered 的透明能力,收进同一个 7B checkpoint。

Qwen-Image-2.1 到底是什么

Qwen-Image-2.1 是千问图像系列的最新成员。它的视觉生成部分刻意保持紧凑:7B 参数、32 层 Single-Stream DiT(单流扩散 Transformer)结构。在官方公告中,千问将其定位为系列里生成质量、推理效率与使用成本平衡得最好的开源图像模型。

结构上的变化在于"合一"。此前千问的图像模型是分工的:Qwen-Image 负责文生图,Qwen-Image-Edit 负责编辑,2025 年 12 月发布的 Qwen-Image-Layered 负责透明图像生成。2.1 把编辑与透明能力折叠进了生图所用的同一套权重。官方 ComfyUI 文档的表述很直接:工作流在"生成图像"与"编辑图像"之间切换时,不再需要更换 checkpoint。

模型还会根据提示词自行决定输出模式:描述一个普通场景,得到常规图像;描述一个透明素材,得到带 alpha 通道的图像。不需要单独调用什么"透明模型"。

7B 为什么能打:效率设计

小模型通常要在质量或速度上让步。Qwen-Image-2.1 的效率论证建立在公告中描述的两个机制上:

  1. 混合粒度注意力。文本 token(系统前缀与编辑指令)使用 token 级因果掩码处理,图像内容则按 chunk 使用 chunk 级掩码。不同类型的内容获得不同的注意力策略,而不是一刀切。
  2. KV Cache 复用。在编辑任务中,输入图像与编辑指令被当作静态前缀:首步计算一次、缓存,后续步骤直接复用。这减少了重复计算和显存开销——按 ComfyUI 官方文档的说法,多图输入场景收益最明显,而这恰恰是参考图编辑最吃算力的地方。

对使用者来说,结论比机制简单:参考图编辑是大多数编辑管线里最昂贵的部分,而这个架构优化的正是这一段。

RGBA 透明概念示意图:一张物体照片被分离为主体图层,背景为透明棋盘格,可直接用于合成

透明能力有三个方向:按提示词生成 RGBA、在透明图层内编辑、从普通照片中提取主体。

原生透明,从头到尾

透明能力是这次发布最有辨识度的部分,它体现在三个方向上:

按提示词直接生成透明图像。模型卡建议为 RGBA 输出使用明确的提示词格式——先告诉模型"This is an RGBA image with transparency",再描述主体,比如一个背景透明的卡通龙贴纸。对贴纸设计、营销素材,以及一切"先生成、再抠图"的合成工作流来说,这一步被直接省掉了。

**在透明图层内编辑。**因为透明是原生能力而不是事后附加,你可以在保持 alpha 通道完好的前提下编辑 RGBA 图像的内容——官方示例包括修改主体的表情,以及把透明图层里的文字换掉而背景保持透明。

**从真实照片中提取主体。**给模型一张普通 RGB 照片,它可以把主体提取成带透明通道的 RGBA 图层。抠图和素材准备,从此住在生成与编辑所在的同一个 checkpoint 里。

编辑工具箱:更多参考图,更精确的控制

编辑能力的提升可以按公告里的四个字来记:多、局、保、全——更多参考图、局部控制、保真、任务全面。

**最多 10 张参考图。**官方示例把六张人像合成一张合影,把模特、衣服、鞋、包、帽子五张图合成完整穿搭,还用十张家居图生成了一套室内布置。多主体、多素材的合成是最显眼的用法。

**三种圈定编辑区域的方式。**你可以在图上画不同颜色的圆圈并在指令中分别指认(官方演示里是"去掉蓝色圈的手表、把红色圈的头发改黑"),也可以涂抹标出区域,或者把原图与独立掩码作为两张图片分别输入——掩码方式能完整保留编辑区域之外的原始像素。

**保真是明确目标。**发布信息特别强调两件事:人像编辑前后面部特征保持稳定(身份一致性),以及商品放进新场景时文字、纹理、形态不走样。这些是官方公告声明的优化方向;在你的具体素材上表现如何,仍需要用自己的内容来验证。

**任务覆盖面广。**官方示例越过了常规编辑:从一张自拍生成可环视的全景图,把一张模特照扩展成信息量很大的信息图,再比如根据人物三视图生成分镜。

千问还宣称改进了文字渲染——不只是清晰度,还包括字体与排版——以及人物光影与细节。公告引用了 Qwen-Image-Bench 与其他开源、闭源模型的公开评测对比;我们没有独立验证这些分数,排名请当作厂商自己的展示,而不是定论。

今天就能上手的三种方式

**1. 零安装:官方在线 Demo。**千问在 Hugging Face 上运行官方 Demo Space,可以直接生成图像,或上传最多 10 张图片用文字指令修改。在安装任何东西之前,这是验证模型是否适合你的用例的最快方式。

ComfyUI 官方文档的 Qwen-Image-2.1 原生工作流页面,列出文生图、图像编辑和抠图三套模板

来源:ComfyUI 官方文档(docs.comfy.org),2026 年 9 月 22 日访问。

2. 本地工作流:ComfyUI。ComfyUI 官方文档提供了 Qwen-Image-2.1 的原生工作流,含三套模板:文生图、图像编辑和抠图(remove background)。文档强调了原生 2K 输出——直接生成最高 2048×2048 的图像,而不是先生成小图再放大——以及透明通道支持,编辑工作流还有专门的 KV cache 说明。

3. 代码:diffusers。模型卡为 diffusers 库提供了 QwenImage21Pipeline。文档示例使用 bfloat16 与 40 步推理,显存紧张时可以用 enable_model_cpu_offload()。模型卡列出的支持宽高比如下:

宽高比 分辨率
1:1 2048 × 2048
4:3 2400 × 1792
3:4 1792 × 2400
3:2 2528 × 1696
2:3 1696 × 2528
16:9 2752 × 1536
9:16 1536 × 2752

注意这些都是原生输出分辨率——2K 级别的工作不需要额外接放大器。

许可这一关:开放权重,受限使用

这是发布会报道最容易跳过的部分。权重以 Qwen Research License Agreement(2026 年 9 月 20 日发布)开源,条款对打算真刀真枪干活的人很重要:

  • 许可只授予非商业用途——研究或评估——下的使用、复制、分发与修改。
  • 商业用途需要向千问单独申请许可
  • 如果你用该模型或其输出去训练、微调或改进另一个对外分发的 AI 模型,必须在产品文档中显著标注 "Built with Qwen"(或 "Improved using Qwen")。
  • 不能用"Qwen"作为衍生产品的主名称;"fine-tuned from Qwen Image"这类描述性表述是允许的。

实际含义是:研究者、折腾者和测试工作流的设计师可以放心上手;而要把权重接进付费产品的创业公司则不行——除非先拿到商业协议。"开放权重"和"任意免费使用"是两回事,对 Qwen-Image-2.1 来说,这个差别写在合同里,不是理论上。

自己跑权重还意味着自己准备 GPU、环境与维护。如果你的目标只是今天就用上千问驱动的图像编辑、又不想折腾本地环境,SketchTo 的 Qwen Image Edit 工具在浏览器里就能用,每次编辑 3 积分——它基于 20B 级的 Qwen Image Edit 模型而非 2.1,你可以在 2.1 生态(和它的授权选项)尘埃落定之前,先用它完成千问系的编辑工作。

现在适合谁上手

Qwen-Image-2.1 是千问第一个让生成、编辑、透明素材共享一个小型统一 checkpoint 的图像模型。如果你是研究统一图像模型的研究者、想要免切换 checkpoint 的透明与编辑能力的 ComfyUI 用户,或者工作流从头到尾都在跟 RGBA 素材打交道的贴纸、电商、合成方向设计师,这个组合是真正有用的。

如果你要把权重做进商业产品,许可条款就是决策点——在确定技术方案之前,先去申请商业授权条款。而如果你今天只需要在浏览器里完成靠谱的千问系编辑,那什么都不用安装。

无论选哪条路,方向已经清晰:图像 AI 的专用模型时代正在收敛为单个、高效、统一的 checkpoint——而透明度这个长期依赖手工后处理的环节,正在变成生成层面的原生能力。

用 AI 转换你的图片

将草图变成精美图片、移除背景、换脸等等——全部由 AI 驱动。

免费试用 Sketch To

分享

S团

SketchTo 团队

专注 AI 工具、图像处理和创意工作流的技术写作者。

相关文章