谷歌推出 Gemini Omni 1.1 Flash 视频模型,最高可生成 4K 成片

谷歌发布 Gemini Omni 1.1 Flash 视频生成模型,最高支持 4K 分辨率输出,并首次打通从分镜预览到成片交付的完整工作流,视频生成正从“可预览”走向“可交付”。

一句话看懂:谷歌发布 Gemini Omni 1.1 Flash 视频生成模型,最高支持 4K 分辨率输出,并首次打通从分镜预览到成片交付的完整工作流,视频生成正从“可预览”走向“可交付”。

事件核心:发生了什么

谷歌于 8 月 28 日宣布推出 Gemini Omni 1.1 Flash 视频生成 AI 模型。与标准版 Omni 1.1 最高 720p 的分辨率不同,新模型最高可输出 4K 视频,但相应地在生成速度和推理成本上做出了取舍,定位明显偏向专业制作场景。

该模型在产品层面提供了几项关键能力:一是场景扩展,用户可以基于已生成的视频片段,以 10 秒为增量连续生成后续画面,单个片段最长可达 40 秒;二是首尾帧控制,用户只需指定起始和结束画面,即可实现平滑的镜头过渡与运镜;三是视频参考功能,支持引入最多 3 秒的参考片段,以维持上下文和角色一致性。

价格方面,分层结构比较清晰:360p 预览分辨率每秒收费 0.03 美元,生成速度比标准版快 60%,成本仅为标准版的三分之一,适合快速分镜迭代;720p、1080p 和 4K 分辨率则分别按每秒 0.1 美元、0.15 美元和 0.3 美元计费。

为什么重要

这一产品的核心意义在于,谷歌正在用“预览-成片”分层定价的方式,把视频生成从原型验证推进到可交付的工业流程。过去,AI 视频生成主要停留在低分辨率快速出片,难以满足商用素材的清晰度要求;Gemini Omni 1.1 Flash 的出现,让创作者可以在同一模型体系内完成从分镜草稿到 4K 成片的连续生产,无需在不同工具之间迁移。

从竞争格局看,这意味着头部大模型厂商在视频生成领域的竞争焦点,正从“能不能生成”转向“能不能交付”。4K 输出结合首尾帧控制和长片段扩展,瞄准的是广告、影视预演、短视频批量生产等真实商业需求。同时,分层定价策略也释放了一个信号:视频生成算力成本依然很高,厂商正试图通过降低预览门槛来获取更多用户,再通过高分辨率输出来实现商业变现。

对用户/开发者/创作者的影响

对普通内容创作者而言,360p 预览模式提供了低成本试错空间,适合快速验证分镜想法;而 720p、1080p 和 4K 档位则为最终素材交付提供了明确路径——如果生成质量稳定,创作者有望在一个工具内完成从创意到成片的全部流程。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对开发者来说,谷歌的 API 定价结构意味着可以更精准地控制成本:预览阶段用低价档位批量测试,进入正式制作时再切换到高分辨率档位。视频参考和首尾帧控制能力则降低了在更长时间维度上保持叙事连贯性的技术门槛。不过,目前公开信息显示,该模型的具体API开放范围、调用限制以及是否面向中国地区提供服务,尚需等待谷歌官方进一步公布。

值得关注的后续

产品落地后的实际生成质量是第一个观察点——4K 分辨率是否真正稳定,长片段下角色一致性能否保持,都需要等开发者实测反馈验证。

其次是定价的可持续性。当前 4K 每秒 0.3 美元的价格在商业场景中是否具备成本竞争力,将直接影响专业团队的采用意愿,同时也要看 OpenAI、Runway 等竞品是否会跟进类似的“预览-成片”分层策略。

最后,视频参考和首尾帧控制是否会上线独立的微调或编辑接口,以及这些能力未来能否与谷歌其他生成式 AI 工具(如图像生成、视频编辑、大模型推理)形成闭环,值得持续追踪。

来源:AIbase

celebrityanime
celebrityanime
文章: 20749

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注