阿里开源Qwen-Image-2.1,7B模型打通透明图生成与编辑

来源:互联网 时间:2026-09-21

A5站长网9月21日消息,通义千问团队把Qwen-Image-2.1的模型权重开放下载。这个模型把文生图与图像编辑合并进同一套流程,视觉生成部分只有7B参数,官方给出的定位是兼顾生成质量、推理效率与使用成本。与前代最大的不同是原生支持透明图像的生成与编辑:模型根据提示词自行判断该输出普通图像还是带透明通道的RGBA图像,也能把照片里的主体抠成带透明度的图层,方便后续设计复用。权重已在GitHub、Hugging Face与ModelScope发布,并配了在线试用入口。

透明能力此前是单独的一条产品线。2025年12月发布的Qwen-Image-Layered专门负责透明图像生成,这次把它整合进统一模型,等于减少了模型数量与部署环节。除了单主体,模型还能生成由多个元素组成的复杂透明图;透明图层里的文字也能直接改,官方演示把图层上的字样替换成新的品牌名。对做素材、做电商图的团队来说,能直接产出带透明通道的成品,比事后抠图省下的不只是时间。

编辑能力是这次更新的另一半。模型支持最多10张参考图输入,可以把六张单人照合成一张合影,也可以把模特、衣服、鞋、包、帽子五张图拼成一套完整穿搭,室内设计场景则用10张家具图生成整间房间的布置。局部修改提供三种指定方式:不同颜色的圈选可以一次标注多个区域,涂抹标记适合粗略位置,也可以直接传入原图加独立蒙版,避免圈选覆盖住原始画面。

效率上的改动来自注意力结构。文本部分,包括系统前缀和编辑指令,走Token级因果掩码;图像生成部分走Chunk级掩码,两种粒度分开处理。KV Cache复用让输入图像与编辑指令作为静态上下文在首步预计算并缓存,多图输入时推理效率与显存占用的改善更明显。官方还提到原生支持2K输出与多种画幅比例。

使用上有一条需要留意。权重虽然公开,但仓库采用研究许可,禁止直接商用,企业要把模型接进生产流程需要单独申请商业授权。对个人开发者与研究者来说没有这层限制,配合消费级显卡就能跑起来。发布数小时内官方宣布支持ComfyUI,这类工作流工具的接入速度,往往比跑分更能决定一个开源图像模型的实际使用率。

把这套功能放到一起看,开源图像模型的竞争点已经不在能不能生成好看图,而在工程细节:能不能输出带透明通道的素材、能不能守住多张参考图里的人物与商品一致性、能不能被现有创作工具直接调用。谁把这些环节做扎实,谁就更接近真实的创作流程。

相关文章

标签:

A5创业网 版权所有