​生数科技正式发布 Vidu S2,支持实时编辑、动态参考图与头显适配

生数科技于 9 月 15 日正式发布 Vidu S2 视频大模型系列,包含面向连续交互数字人的 S2-Avatar 和面向实时视频流编辑的 S2-Editing,并首次将实时空间视频生成与编辑能力延伸至 VR 头显。这意味着视频生成正从"一次性出片"向"可交互、可动态调整、可穿戴端消费"演进。

一句话看懂:生数科技于 9 月 15 日正式发布 Vidu S2 视频大模型系列,包含面向连续交互数字人的 S2-Avatar 和面向实时视频流编辑的 S2-Editing,并首次将实时空间视频生成与编辑能力延伸至 VR 头显。这意味着视频生成正从”一次性出片”向”可交互、可动态调整、可穿戴端消费”演进。

事件核心:发生了什么

此次发布的 Vidu S2 包含两条核心产品线。S2-Avatar 面向连续交互数字人:用户上传角色图像后,可通过文字或语音驱动,模型支持说话时的表情与姿态,并强化了跳舞等大动作的指令跟随能力。更关键的是,它允许在视频流中随时动态加入物品、服装或背景参考图,实现”拿起杯子””换上指定服装””进入新场景”等操作,并通过视觉反馈机制校验连续动作的可靠性,例如确认”拿起杯子后再微笑”是否完成。实时输出分辨率从前代 540P 提升至 720P,技术负责人为生数科技流式视频生成与推理负责人、朱军教授博士生张津涛。

S2-Editing 则接收连续视频流,基于文本指令和可选参考图进行实时编辑,目前主要覆盖四类任务:风格迁移、虚拟试穿、角色替换和背景替换。在空间视频方向,Vidu S2 将 Avatar 实时输出接入空间视频转换,生成同步左右眼视图,编辑结果可直接串流至 VR 头显。

底层技术方面,Vidu S2 提出 Self-Replay Forcing(SRF)训练方法,通过生成长自生成轨迹、采样连续片段并重新加噪进行因果回放训练,缓解身份漂移与动作断裂;同时引入 VLM 智能体作为视觉反馈校验动作完成度,并结合轻量单步 Refiner、TurboDiffusion 与 TurboServe 降低算力开销。公开评测中,S2-Avatar 在 StreamAV-Bench 九项指标取得最佳,S2-Editing 在 OpenVE 与 RefVIE 联合评测得分 4.26,并在 Sparkle-Bench 全指标领先。

为什么重要

视频大模型此前多停留在离线生成或短片段输出,Vidu S2 把”实时编辑”和”持续交互”推到前台,直接对标直播、虚拟人、电商试穿等对延迟敏感的场景。动态参考图能力让生成过程从”预设提示”变为”过程中可控”,这对创作者工作流是结构性变化。空间视频与头显适配则打开了一个新的分发终端,目前公开信息显示该方向仍处于固定视角探索阶段,能否在头显内维持清晰画质和低延迟仍是待解问题。

对用户/开发者/创作者的影响

对创作者而言,720P 实时数字人加上动态换装、换背景,意味着短视频、直播和虚拟试穿内容的生产门槛可能进一步下降,风格迁移与角色替换可用于快速迭代素材。对开发者,S2-Editing 的连续视频流编辑接口若开放 API,将适合接入直播工具、在线教育或视频会议类应用,但需关注实时推理的算力成本与并发能力。对企业采购方,虚拟试穿和背景替换的稳定性是评估重点,目前公开信息显示其在 ViViD 试穿测试中明显领先,但实际商用效果仍需场景验证。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是 Vidu S2 是否开放 API 及定价策略,将决定开发者生态能否快速起量;二是 VR 头显端空间视频的实机延迟与画质表现,以及是否适配主流头显平台;三是竞品在实时视频编辑与数字人方向的跟进节奏,尤其是开源模型能否在同等任务上缩小差距。

来源:AIbase

celebrityanime
celebrityanime
文章: 23809

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注