
一句话看懂:通义千问发布新一代图片生成模型 Qwen-Image-3.0,在中文长文本排版、多语言混合输出和多图融合等方向上表现突出,实测认为已能与GPT-4o的Image2能力对标,成为国产图片模型的又一推动力。
事件核心:发生了什么
2025年初,阿里通义千问团队上线了最新的图片生成模型 Qwen-Image-3.0。该模型支持最高 4500 token 的输入指令、12种语言、20多种字体,具备多图融合、图中图和图片编辑能力。从公众号“卡尔的AI沃茨”发布的实测来看,该模型能够在单张图片中准确生成包含十二道菜名的中英文菜单、六种语言的说明书、表格化科普图鉴,以及实现换装、替换商品、清除反射物等修图操作,且在中文字形和排版精度上表现稳定,未出现常见的文字模糊或错位。
为什么重要
当前图像生成领域,OpenAI 的 GPT-4o 附带 Image2 能力在文字渲染和多步推理上仍具标杆地位。Qwen-Image-3.0 在中文长文本、多语言混排和多图融合任务上的实测表现,已与 Image2 处于同一水平线。这意味着国产模型在“文生图”这一硬核技术上实现了实质追平,尤其解决了过去中文 AI 图片“字乱、字糊、字跑位”的核心痛点。对于阿里自身,这提升了通义千问在创作者工具、电商海报、商业设计等场景的竞争力,也为国内开发者提供了一个可直接使用的、无需翻墙的备选方案。
对用户/开发者/创作者的影响
对创作者和设计师:可直接使用 Qwen-Image-3.0 生成中文海报、菜单、科普图鉴等需要大量文字和表格内容的图片,微调和改图功能(如图片扩为横版、替换文字且保持原字体)能大幅缩短反复修图的工作流,且零成本上手。
对开发者:该模型支持通过 API 调用,接口响应速度快,在需要批量生成带文字的封面、产品说明书、多语言 UI 原型时,可降低对国外模型的依赖,提高国内部署的合规性与响应速度。
对普通用户:目前在通义千问官网即可体验,门槛低、免费,适合快速制作社交媒体配图或教育类信息图。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
第一,目前模型是否开放 API 及具体价格尚未完全明确,若后续以合理价格开放,将对中小型创业团队和电商卖家形成直接利好。第二,GPT-4o 的 Image2 已在多语言和精细编辑上持续进化,Qwen-Image-3.0 能否在后续版本中保持领先并增加“图中图”的多轮编辑能力,将是后续竞争的焦点。第三,这一模型是否会作为开源权重发布尚未确认,如果开源,将极大加速下游生态(如本地部署、LoRA 微调)的繁荣。
来源:公众号:卡尔的AI沃茨


