一句话看懂:Google 于 8 月 27 日发布 Gemini Omni 1.1 Flash 视频生成模型,支持最高 4K 分辨率输出,并新增场景连续扩展与镜头运动控制能力。这是继图像生成之后,头部大模型厂商在视频生成方向对高分辨率与专业创作工作流的一次明确补位。
事件核心:发生了什么
当地时间 8 月 27 日,Google 正式推出 Gemini Omni 1.1 Flash 视频生成 AI 模型。根据官方公开信息,该模型在功能上有三项关键变化:一是支持从现有视频末尾无缝续接生成,每次扩展 10 秒,最长可生成 40 秒视频;二是允许用户指定镜头的起始帧与结束帧,实现平滑转场和可控镜头运动;三是支持引入最长 3 秒的参考视频片段,用于保持新场景中的背景与角色一致性。
在输出规格上,Gemini Omni 1.1 Flash 提供多档分辨率选项。其中 360p 预览模式相比标准 720p 生成速度最高提升约 60%,成本约为后者的三分之一,适合快速原型验证与故事板迭代;最高支持 1080p 或 4K 分辨率直接输出成片。目前公开信息显示,该模型定位为面向开发者与专业创作者的高性能工具。
为什么重要
视频生成模型过去的主要瓶颈集中在分辨率、时长控制和创作可控性。此前多数产品的输出规格停留在 1080p 级别,较长片段的生成往往依赖多次拼接,且镜头运动参数化支持有限。Gemini Omni 1.1 Flash 将 4K 输出纳入标准能力,同时把场景扩展、镜头起止帧控制、角色一致性参考片段这些偏向专业后期流程的功能直接内置到模型层,意味着视频生成正在从“能出图”向“能出片”过渡。
从行业竞争角度看,Google 选择在视频生成上同时强调分辨率上限与成本下限(360p 低成本档),实际上是在双向挤压竞品空间:高端创作场景拼画质与运镜,批量生产场景拼算力成本。这一策略与当前大模型厂商在图像生成领域的打法类似,即通过分档定价覆盖更宽的用户群体。
对用户/开发者/创作者的影响
对专业创作者:40 秒连续生成长度与 4K 输出直接降低短片制作中对额外剪辑和后期修复的依赖。尤其是镜头起止帧控制功能,让有明确分镜需求的创作者不必依赖文本描述去“碰运气”,而是通过指定视觉锚点获得更稳定的成片结果。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
对开发者:模型提供 360p 低价档作为预览模式,适合在 API 调用中做批量测试、参数调优和快速迭代,待确认方向后再以高分辨率渲染最终内容,这有助于控制开发阶段的推理成本。
对普通用户:目前功能设计偏向专业工作流,普通用户短期内能感知到的变化有限,但 3 秒参考片段保持角色一致性的能力,未来可能被集成到更易用的消费级工具中。
值得关注的后续
第一,4K 与 40 秒生成能力的实际调用价格和 API 上线时限尚未完全公开,需要等待 Google 公布具体的计费标准与配额限制,这直接决定了该模型能否真正进入中小团队的工作流。
第二,镜头运动控制是否支持精细参数(如推拉摇移的具体幅度)仍待实测验证。如果只能指定首尾帧而无法控制中间路径,对于复杂运镜需求的覆盖能力仍然有限。
第三,竞品反应值得跟踪。OpenAI、Meta 以及国内头部视频生成模型厂商是否会在短期内在分辨率或时长维度跟进,或将引发新一轮视频生成模型的规格竞赛。
来源:AIbase


