支持5张参考图融合与智能扩图,xAI Imagine Image2.0正式上线

xAI 于 8 月 10 日发布 Imagine Image 2.0,为 Grok 的 Web 端和移动应用带来可控性更强的图像生成能力,支持 5 张参考图融合、智能扩图和局部精准编辑。API 尚未开放,但产品形态已经明显从“聊天生图”转向“可进入创作流程的图像工具”。

一句话看懂:xAI 于 8 月 10 日发布 Imagine Image 2.0,为 Grok 的 Web 端和移动应用带来可控性更强的图像生成能力,支持 5 张参考图融合、智能扩图和局部精准编辑。API 尚未开放,但产品形态已经明显从“聊天生图”转向“可进入创作流程的图像工具”。

事件核心:发生了什么

xAI 在 2026 年 8 月 10 日宣布推出 Imagine Image 2.0,对应 Grok 中 Web 版 Imagine 服务及 iOS、Android 应用的新质量模式。官方介绍称,该模型可以理解复杂指令,在密集构图下完成字体和排版规划,并保持小字号文字的清晰度;同时支持多轮生成与编辑,在反复调整中保留用户指定的视觉元素。

具体能力包括:使用魔棒和分割工具实现图像区域的精准选择与局部修改、背景移除与透明图像导出、单图融合最多 5 张参考图,以及智能扩图功能。扩图支持 1:2 到 9:16 的宽高比范围,也包含方形、横向和 2:1 格式。此外,xAI 为用户提供了可重复使用的模板工作流,覆盖照片编辑、产品换色、电商图像、专业头像、图标、角色精灵、表情符号和产品设计等场景;在视频策划场景中,模板可辅助用户分别生成角色、场景和道具,同时维持一致的视觉风格。

目前公开信息显示,Imagine Image 2.0 的 API 访问计划仍在开发中,尚未正式向开发者开放。

为什么重要

这次更新的关键不在“画质提升”,而在于 xAI 正在补齐图像生成在落地使用中的短板:排版文字清晰度、多图元素一致性、局部修改精度和后期扩展能力,恰好是广告设计、电商素材、内容制作中最常遇到的硬性需求。过去大模型生图常被当作“出草稿”的工具,而 Imagine Image 2.0 试图通过模板工作流和多轮编辑,把生成环节嵌入更接近真实生产的流程中。

从行业竞争看,xAI 选择在 Web 端和移动端优先上线,而不是抢发 API,说明它当前更重视在 Grok 生态内验证产品体验。这个节奏与 OpenAI、Google 的图像模型走 API 优先的路线有所不同,后续 API 的定价和开放策略将直接影响 xAI 在开发者市场的位置。

对用户/开发者/创作者的影响

对普通用户来说,最大的变化是降低了“精确控制”的门槛。过去想在图中改一个局部元素或统一多张图的风格,往往需要在提示词里反复描述,效果难以保证;现在通过选区编辑、参考图融合和模板,可以更直接地完成这些操作。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对创作者尤其是电商、设计、营销类内容生产者,5 图融合与智能扩图是实际价值较高的功能:它减少了多素材手工合成的成本,也让主图延展到不同投放尺寸变得更简单。视频策划场景下的角色、场景、道具分开生成和风格统一能力,则对创意前期开发有帮助。

对开发者而言,目前没有 API 可用,意味着暂时无法基于 Imagine Image 2.0 构建第三方应用。如果后续 API 接入,多图融合和模板工作流是否能以参数化方式开放,将决定它的可编程性和差异化竞争力。

值得关注的后续

第一,API 的正式发布节奏与计费方式。这将直接影响开发者生态的建立速度,尤其在图像生成赛道已有多家强势闭源模型的情况下,xAI 的定价策略会成为开发者是否迁移的关键考量。

第二,竞品是否跟进“多图融合+区域编辑+模板”这套组合。这类能力的技术门槛在于如何保持多轮编辑中的一致性,谁能把这套体验做得更稳定,谁就更有机会进入专业创作工具链。

第三,模板工作流能否延伸到视频生成。xAI 已经提到了视频策划场景,但尚未展示实际视频产出。如果后续将这套可控编辑思路从静态图像扩展到视频,将是更值得关注的进展。

来源:AIbase

celebrityanime
celebrityanime
文章: 18306

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注