Runway 想将 AI 视频生成变成你可以实时控制的直播流

Runway 正在研究让 AI 视频生成变成实时直播流——用户一边描述、模型一边逐帧生成,而不是输入提示词后等待成品。这背后是它从 Gen-4.5、GWM-1 到实时模型的连续布局,核心目标是压缩“出第一帧”的时间。

一句话看懂:Runway 正在研究让 AI 视频生成变成实时直播流——用户一边描述、模型一边逐帧生成,而不是输入提示词后等待成品。这背后是它从 Gen-4.5、GWM-1 到实时模型的连续布局,核心目标是压缩“出第一帧”的时间。

事件核心:发生了什么

Runway 公开了其实时视频生成研究的进展。目前市面上的视频模型基本是“提交提示词—等待数秒到数分钟—拿到成品”的分步流程,结果不满意就得重来。Runway 想改成用户持续描述、模型同步流式输出,尽量缩短首帧等待时间。

这条路线的技术底座是该公司 2025 年 12 月发布的首个“通用世界模型”GWM-1,它建立在 Gen-4.5 之上,逐帧生成视频,并接受镜头运动、机器人指令或音频作为控制信号。Runway 今年 3 月已通过 Runway Characters 展示过类似思路,几周前还展示了用 Gen-4.5 逐帧生成用户界面的 Solaris,可响应点击和语音。此外,Runway 与英伟达合作的一款实时模型在 GTC 上做过研究预览,运行于 Vera Rubin 平台,目标首帧延迟低于 100 毫秒。目前公开信息显示,Runway 并未公布这些能力的正式上线时间。

为什么重要

实时生成不只是体验问题。Runway 的判断有两层:一是把计算负载从训练端转移到了推理端,模型必须在播放速度内逐帧产出,还要在同一硬件上并行支撑多个会话,这对推理效率是硬考验;二是成本逻辑——单位质量输出的成本决定了哪些应用在经济上成立,延迟和算力降下来,原本不划算的场景才可能跑通。

技术难点也很明确:语言模型可以在句子中途纠错,但视频模型每一帧都建立在上一帧之上,小误差会累积成明显失真。Runway 的做法是在训练中故意让模型接触自己生成的、有缺陷的输出,教它修正偏差而不是放大偏差。Decart 的实时模型 MirageLSD 用了类似思路;Google DeepMind 的 Genie 3 则宣称能在 720p、24 帧下保持交互世界数分钟的一致性。路线正在趋同。

对用户/开发者/创作者的影响

对创作者而言,工作方式可能从“抽卡式生成”转向“边看边调”,时间更多花在主动引导画面上。对开发者,如果实时模型以 API 形式开放,交互式内容、教育、游戏、机器人仿真这些需要即时反馈的场景会多一个可选项。Runway 特别强调机器人、自动驾驶等具身智能方向——GWM Robotics 就是为机器人生成合成训练数据的分支;Waymo 的 Waymo World Model 也是基于 Genie 3 改造,用于模拟车队从未见过的极端路况。目前这些都还在研究阶段,能否稳定商用、价格如何,都无公开答案。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是 Runway 何时公布实时能力的可用时间和 API 形态,首帧 100 毫秒能否在真实负载下兑现;二是这类模型的定价与并发成本,决定开发者是否用得起;三是竞品跟进节奏,以及实时生成在机器人、自动驾驶仿真中的实际落地效果。

来源:The Decoder AI News

celebrityanime
celebrityanime
文章: 24602

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注