你做一张活动海报,往往要先让 AI 生成底图,再换一个工具抠出人物,又换一个模型修改服装或背景。每次切换,都可能丢掉人物长相、商品细节或透明图层。Qwen-Image 2.1 想把这些步骤收进同一个模型:它既能从文字开始作图,也能读入图片继续编辑,还能直接处理带透明背景的素材。
这也是它值得现在关注的原因。开放权重图像模型正在从单一的“文生图”走向完整工作流,而 Qwen-Image 2.1 发布后很快进入模型热榜前列。这里的“开放权重”是指训练完成的模型参数可以下载和运行,并不代表训练代码、数据和使用权都完全开放。后者仍要看许可证。
一套模型,从空白画到局部修改
Qwen 将 Qwen-Image 2.1 定义为统一的图像生成与编辑模型。用户可以用一句文字从零生成图片,也可以给它一张现有图片,再说“把背景换成落日海滩”。这省掉了在不同模型之间导出、转换和重新描述素材的步骤。
它的视觉生成组件有 70 亿参数,包含 32 层 Single-Stream DiT。DiT 可以理解为用于扩散生成的 Transformer 结构;扩散模型则像从一团噪点里逐步擦出画面,是当前图像生成工具常见的路线。需要注意,70 亿只指视觉生成组件,不能据此说整个系统只有 70 亿参数。官方文件中还出现了单独的 qwen3vl_8b 文本编码器。
官方称,模型采用 mixed-granularity attention 和 prefix KV cache reuse。前者让模型以不同粒度处理图像信息;后者复用已经算过的中间结果,像保留一页草稿,避免面对多张参考图时反复从头计算。现有材料只说明这些设计用于降低计算成本、提高多图输入效率,没有给出速度、显存或成本对比。
透明图,不必再绕一圈
这次最直观的变化是原生支持 RGBA。普通 RGB 图像记录红、绿、蓝三种颜色;RGBA 多出 Alpha 透明度通道。对设计工作来说,这意味着模型可以直接生成透明背景的贴纸或素材,也能编辑透明图层,并从照片中提取主体,方便后续叠加和排版。
编辑能力也覆盖了更复杂的输入。模型最多接受 10 张参考图,可以用圆圈、涂画标注或独立 mask——也就是明确标出修改范围的遮罩——指定局部区域。Qwen 还称它能在编辑时保持人物身份和产品外观的一致性。不过材料没有第三方实测,这一点目前仍主要是官方表述。
官方示例以 2048×2048 分辨率、40 个推理步骤生成图片,并列出从 1:1 到 9:16 的多种画幅。这些是示例设置,不代表模型的最高分辨率,也不能理解成所有任务都必须使用 40 步。
热度之外,更值得看的是工作流
Qwen 宣称 2.1 改进了排版、肖像光照、精细细节和真实纹理,并擅长全景图、信息图和虚拟试穿。社区转述还称其质量超过多数闭源模型、兼顾成本与效果。但材料没有提供基准名称、测试集、对手模型、评分或硬件数据,因此这些说法不能当作已经验证的结论。
更扎实的看点,是它把生成、参考图编辑、局部控制和透明图层放进了同一条链路。Comfy-Org 已为 ComfyUI——一种节点式图像生成工作流工具——重打包 BF16、INT8 ConvRot 和 W4A8 等版本。它们使用不同的数值精度和压缩方式,方便用户按设备条件选择。截至材料记录时,该重打包页面近一个月显示 535,365 次下载;这只是会随时间变化的页面数据,不是 Qwen 官方仓库的下载量。
“开放”到底开放到哪里
许可证是这次发布不能略过的一部分。Qwen 团队使用了“open-source”的说法,但 Qwen-Image 2.1 实际采用 Qwen Research License Agreement。根据 QwenLM GitHub 上新旧版本的许可证,上一代 Qwen-Image 使用 Apache 2.0,而 2.1 转为仅允许研究与评估;商业使用需要另行邮件申请。协议还规定,如果使用模型输出来训练并发布另一个 AI 模型,需要显著标注“Built with Qwen”或“Improved using Qwen”。
所以,更准确的称呼是“开放权重模型”。权重可以下载,不等于可以不受限制地商用,也不等于传统开源软件意义上的完整开放。对个人试验者,这可能只是安装前多读一页协议;对准备把模型放进产品的团队,它会直接影响能否上线。
局限与未知
- 画质、人物与产品一致性,以及“超过多数闭源模型”等结论,尚缺少材料中的独立测试支持。
- 官方没有披露可核验的速度、显存和成本对比,无法判断所谓高效率在不同设备上能兑现多少。
- 权重虽然可下载,但许可证限制研究、评估与衍生模型发布方式;商业使用者需要单独确认授权。