通义千问开源 Qwen-Image-2.1:7B 参数实现文生图与图像编辑一体化

阿里通义千问团队于 9 月 21 日开源 Qwen-Image-2.1,用 7B 参数的单一模型同时完成文生图、透明图生成和图像编辑,免费开放给开发者与创作者。

一句话看懂:阿里通义千问团队于 9 月 21 日开源 Qwen-Image-2.1,用 7B 参数的单一模型同时完成文生图、透明图生成和图像编辑,免费开放给开发者与创作者。

事件核心:发生了什么

9 月 21 日,通义千问团队正式开源新一代图像模型 Qwen-Image-2.1。其视觉生成模块只有 7B 参数,采用 32 层 Single-Stream DiT 结构,并通过混合粒度注意力与 KV Cache 复用机制,在多图输入场景下提升推理效率、控制显存占用。模型把文生图、透明图生成和多种图像编辑能力整合进同一框架。

透明图生成是本次更新重点:模型会根据提示词自动判断输出普通图像还是带透明通道的 RGBA 图像,支持在不破坏透明背景的前提下修改主体表情或替换文字。用户也可上传真实照片,由模型自动抠出主体并输出透明图层。

图像编辑方面,Qwen-Image-2.1 最多支持 10 张参考图输入,可融合多个主体与素材生成协调场景;局部编辑支持框选、涂抹和独立 mask 三种方式。官方称人脸与商品一致性有明显提升,文字渲染、人物光影和细节表现也有改进。模型已在 GitHub、ModelScope、Hugging Face 等平台免费开放。

为什么重要

把生成与编辑合并到一个 7B 模型里,意味着开源社区可用较低算力成本覆盖更多图像任务,这对依赖闭源 API 做图像应用的中小团队是一个替代选项。当前文生图赛道竞争集中在生成质量,而“生成+透明通道+精细编辑”一体化,更贴近电商、设计、广告等真实生产流程,也是闭源模型商业化程度较高的方向。通义选择开源这一档能力,会进一步压低同类工具的调用成本,并加剧开源与闭源在图像编辑层的贴身竞争。

对用户/开发者/创作者的影响

对开发者,7B 参数规模相对友好,本地部署和二次开发的显存门槛低于更大参数模型,透明图输出与 mask 编辑也可直接接入设计工具或电商素材流水线。对创作者和设计师,自动抠图、保留透明背景改字改表情,能省去大量手工图层操作,多图参考则适合做产品合成与场景搭建。对普通用户,直接在各平台免费试用即可,无需付费订阅。目前公开信息显示,模型以开源权重形式发布,具体商用许可与 API 服务细节需以官方仓库说明为准。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是 7B 版本在复杂编辑和文字渲染上的实际表现,是否接近其宣传效果;二是开源协议与商用条款是否宽松,决定企业能否放心集成;三是竞品是否跟进“生成+透明图+编辑”一体化路线,以及闭源 API 是否会因此降价。这些将直接影响开发者的技术选型与成本结构。

来源:AIbase

celebrityanime
celebrityanime
文章: 24719

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注