xAI升级 Imagine Video1.5:新增图像语音参考与原生1080p视频生成

xAI 为视频生成模型 Imagine Video 1.5 带来一次重要更新,新增图像参考、语音参考和原生 1080p 视频生成能力,让 AI 视频从“生成一段画面”向“可控的角色与场景创作”迈进了一步。

一句话看懂:xAI 为视频生成模型 Imagine Video 1.5 带来一次重要更新,新增图像参考、语音参考和原生 1080p 视频生成能力,让 AI 视频从“生成一段画面”向“可控的角色与场景创作”迈进了一步。

事件核心:发生了什么

据 AIbase 报道,xAI 于近期推出 Imagine Video 1.5 的升级版本,核心变化集中在四个方向:图像参考、语音参考、文生视频和原生 1080p 输出。目前,文生视频与 1080p 视频生成功能已在 Grok Imagine 网页版、iOS 和 Android 应用上线;图像参考和语音参考功能则率先向美国地区的 SuperGrok Heavy 与 SuperGrok Plus 用户开放,后续再逐步扩展。

这次升级在“控制力”上做文章。官方信息显示,Imagine Video 1.5 单次生成最多支持 7 个视觉参考,用于锁定角色面部、产品外观或环境元素。用户可以在保留角色身份的前提下替换背景,也可以保持场景不变只更换角色,或只调整动作而不改动整体画面设置。语音参考功能则针对 AI 视频制作中的角色一致性问题,让同一角色在多段画面中保持稳定的面容与声音表现。

xAI 同步开放了 API 能力。开发者可通过 grok-imagine-video-1.5 模型调用图像参考、文生视频和原生 1080p 生成,请求参数包括提示词、参考图 URL、视频时长、宽高比和分辨率;语音参考功能则需要通过请求方式额外集成。

为什么重要

这次更新的意义不在于单纯提升分辨率,而是把 AI 视频生成从“一次性生成”推向“可编辑的生产工具”。图像参考加语音参考的组合,意味着创作者可以在不同镜头中维持角色的视觉和声音一致性——这正是 AI 视频在叙事类内容、短剧和广告制作中落地的主要痛点之一。

从行业竞争角度看,xAI 在视频生成上的迭代节奏明显加快。Imagine Video 1.5 上月刚发布,主打运动表现、物理模拟和音频生成优化,此次又补充了多参考控制和高分辨率输出,反映出头部模型厂商正在从比拼“生成效果”转向比拼“生产可控性”。同时,API 的开放也意味着该能力不再局限于 Grok 应用内部,而是进入开发者生态,这对 xAI 在商业化层面的拓展有直接帮助。

对用户/开发者/创作者的影响

对普通用户而言,最直接的感知是可以通过文字描述生成视频,或上传一张图片来指定角色、产品与场景,门槛进一步降低。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对创作者来说,多参考模式的实际价值在于“拆开控制”:背景、角色、动作可以分别调整,不再需要反复抽卡式地修改提示词。语音参考功能尤其适合需要连续人物对话的短剧、口播或品牌内容制作,能够减少换镜头后人物“变脸”的违和感。

对开发者来说,API 的开放值得关注。既然支持传入参考图 URL、时长、宽高比和分辨率等参数,就意味着可以基于该模型搭建自动化视频流水线。不过,语音参考目前的接入方式还依赖请求方法集成,文档细节和调用成本仍待进一步确认。

值得关注的后续

目前公开信息显示,图像与语音参考功能仅向美国部分 SuperGrok 付费用户开放,后续能否覆盖更多地区、以及是否引入按量计费或更低门槛的套餐,值得持续观察。

另一个观察点是 API 的定价和限流政策。对开发者来说,功能开放是一回事,实际可用的成本与稳定性是另一回事。

此外,竞品是否会跟进“多参考+语音一致”的产品方向也值得留意。视频生成本身仍处在快速迭代阶段,各家的差异化能力还在形成中,这一轮 xAI 先出牌,后续产品对比将更有参考意义。

来源:AIbase

celebrityanime
celebrityanime
文章: 16608

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注