Qwen开源图形生成与编辑模型Qwen-Image-2.1
Qwen 发布并开放
Qwen-Image-2.1权重,将文生图和图像编辑统一到一个模型,视觉生成部分为 7B 参数。它原生支持RGBA透明图生成与编辑,最多接收 10 张参考图,并支持圈选、涂抹、独立掩码等局部编辑,同时加强人像和商品保真、文字排版及人物质感。模型还通过混合粒度注意力和KV Cache复用优化多图推理,ComfyUI和vLLM-Omni等在发布当天即提供支持。
Qwen 发布 Qwen-Image-2.1,并开放模型权重。新版本把文生图和图像编辑整合到同一模型,视觉生成部分为 7B 参数、32 层 Single-Stream DiT;主要变化包括更轻量的推理架构、原生透明图像能力、更完整的图像编辑,以及文字和人物视觉表现的提升。
Qwen-Image-2.1 可直接生成和编辑 RGBA 透明图,也能从普通照片中提取主体形成透明图层;编辑最多支持 10 张参考图,并支持圈选、涂抹和独立掩码等局部控制,同时强化人像身份以及商品文字、纹理和形态的一致性。模型还覆盖全景图、信息图和分镜生成,并改进文字排版、人物光影与细节。推理侧采用混合粒度注意力和 KV Cache 复用,减少多图输入时的重复计算;Diffusers、ComfyUI、vLLM-Omni、SGLang 和 LightX2V 均在发布当天提供支持。




相关链接:





