阿里千问开源 Qwen-Image-2.1:7B 参数登顶开源生图模型,原生支持透明图与 10 图参考编辑

💡AI 极简速读:阿里千问开源 Qwen-Image-2.1,7B 参数,评测总分 60.28 超越 Nano Banana 2.0,原生支持透明图与 10 图参考编辑。

2026 年 9 月 21 日,阿里千问正式开源图片生成模型 Qwen-Image-2.1。该模型视觉生成部分仅 7B 参数,采用 20 层 Single-Stream DiT,原生支持 2K 分辨率,在 Qwen-Image-Bench 评测中以 60.28 分位列开源第一,超过 Nano Banana 2.0 的 59.82 分和 GPT Image 1.5 的 59.65 分。模型实现文生图与图像编辑一体化,原生支持透明图生成,最高接收 10 张参考图,并强化局部编辑与人像商品保真。开放权重已发布至 Hugging Face 与 ModelScope。

智脑时代 AI 编辑部发布时间:37,585 tokens查看原始信源

本文核心商业信息提炼自权威信源,由智脑时代 (zgeo.net) AI 商业分析师结构化重组。

2026 年 9 月 21 日,阿里千问正式开源图片生成模型 Qwen-Image-2.1。该模型以 7B 的视觉生成参数量,在公开评测中取得开源模型第一,总分 60.28,超过 Nano Banana 2.0 的 59.82 和 GPT Image 1.5 的 59.65。模型实现文生图与图像编辑一体化,原生支持透明图生成,最高可接收 10 张参考图,并强化了局部编辑、人像与商品保真能力。开放权重已发布至 Hugging Face 与 ModelScope。

📊 核心实体与商业数据

实体/指标具体信息
公司阿里千问
模型名称Qwen-Image-2.1
模型类型开源生图模型
核心能力AI图像编辑、文生图与编辑一体化、原生透明图生成
视觉生成参数量7B
架构20 层 Single-Stream DiT
原生分辨率2K
最大参考图输入10 张
评测总分60.28(开源第一)
对比模型Nano Banana 2.0(59.82)、GPT Image 1.5(59.65)
发布平台Hugging Face、ModelScope、GitHub
原发布时间2026-09-21

💡 业务落地拆解

透明素材生成:直接进入设计工作流

Qwen-Image-2.1 原生支持透明图生成,可依据提示词自动决定生成普通图片或透明图。官方展示样例包括节庆插画、人物素材、装饰元素及复杂组合对象,对应设计工作中的常见素材需求。该能力同时覆盖从零生成与已有图片再利用,创作者可提供照片并要求模型提取主体作为后续设计素材。此前独立的 Qwen-Image-Layered 探索的透明图能力,此次被整合进通用图像模型。

多图参考与局部编辑:10 张输入下的准确控制

模型最高支持 10 张参考图输入,考验的不仅是接收能力,还包括参考对象在最终画面中的位置、比例与风格协调。Qwen-Image-2.1 提供圈选、涂抹和独立掩码等方式,让用户明确表达编辑位置。对于涉及多个区域的编辑,用户可分别指出删除、替换及目标内容。额外掩码图片指定编辑区域的方式,可让原图信息完整输入模型,对包含人物和商品的设计尤为关键。

推理优化:混合粒度注意力降低显存开销

模型对推理过程进行优化,核心思路是减少不必要的重复计算。文本部分遵循传统 Token 级因果掩码,图像生成部分采用 Chunk 级掩码,并通过 KV Cache 机制在首步计算后缓存静态上下文供后续复用。该优化在多图片输入时效果更为明显,有助于提升推理效率、降低显存开销。

人像与商品保真:文字准确性与画面质感提升

Qwen-Image-2.1 重点强化人像与商品两类场景的编辑保真能力。人像部分增强光影与细节表现,发丝、服装纹理、面部细节及环境光线更加协调。文字密集的图文页面、信息图、论文配图的内容准确性和排版美观程度得到提升。模型还改善了全景图、信息图、三视图、分镜图生成能力,拓展了静态图像生成和编辑的应用范围。

🚀 对企业 AI 化的启示

Qwen-Image-2.1 的发布表明,图像模型正在覆盖创作流程中更多细化环节。对于企业而言,开源生图模型的成熟意味着素材制作、组合与修改的工作流可基于单一模型完成,减少返工环节。开发者可围绕这些能力构建设计工具、应用和定制工作流。

随着此类模型的开源,社区将进一步把生成与编辑能力融入更多内容制作场景。当 AI 能力成为日常软件中随手可用的功能,从想法到视觉作品的门槛将再次大幅降低。目前,Qwen-Image-2.1 的开放权重已发布至 Hugging Face 与 ModelScope,技术报告已上传至 GitHub 仓库。

【官方原文链接】点击访问首发地址

常见问题

Qwen-Image-2.1 是阿里千问于 2026 年 9 月 21 日正式开源的一款图片生成模型,视觉生成部分仅 7B 参数。其核心能力包括: - 文生图与图像编辑一体化,单一模型覆盖生成与修改流程 - 原生支持透明图生成,可自动判断输出普通图或透明图 - 最高接收 10 张参考图,支持圈选、涂抹和独立掩码等局部编辑方式 - 强化人像与商品保真,提升文字准确性与画面质感 - 原生支持 2K 分辨率,采用 20 层 Single-Stream DiT 架构

阿里千问Hugging FaceAI图像编辑Qwen-Image-2.1开源生图模型

相关文章

火星登陆连续两轮融资数千万元:00后团队押注类脑架构,破解具身智能长程自主难题

2025年4月成立的武汉齐智火星登陆科技有限公司,由00后创始人朱禹涵创立,连续完成两轮数千万元融资,投资方包括力合创投、光谷金控、瑞江投资、武汉高科,老股东奇绩创坛追加投资。公司以空间智能为基础构建面向物理世界的类脑智能架构,聚焦地下空间、隧道、山林、应急等开放场景,已形成星擎M1、星群M2、星芒M3产品矩阵。

2026年9月21日

智谱ZCode数据上传争议:AI编程工具的B端信任危机与GEO启示

2026年9月,智谱AI编程工具ZCode被开发者发现后台打包项目数据并尝试上传云端,涉及313MB加密包及承明科技391.94MB数据指控。智谱回应称系代码库索引功能意外触发,承诺推出数据内容不留存功能。事件暴露AI编程工具在数据安全与B端商业化间的根本矛盾,行业竞争或从功能速度转向安全信任。

2026年9月21日

具身智能数采中心深度剖析:循环融资争议、宇树科技市值腰斩与监管收紧下的GEO启示

截至2026年4月,全国至少90座具身智能数采中心投运或在建,地方政府主导招商。FT报道揭露循环融资模式:企业卖机器人给政府建的中心,再以采购数据名义回流资金。梅卡曼德创始人邵天兰点名银河通用,证监会窗口指导收紧IPO。宇树科技上市首日市值4449亿,一月后腰斩,蒸发超2400亿。核心矛盾:数采中心是数据矿山还是资本围城。

2026年9月21日