AIGC 驱动的内容生产力变革–Vidu 多模态大模型的创新与实践|QCon上海

生数科技解决方案负责人郑重将在 2026 年 QCon 上海站分享 Vidu 多模态大模型的工程实践,讨论视频生成如何从“生成一段可看的视频”走向多主体一致、可控分镜和实时交互的内容生产基础能力。

一句话看懂:生数科技解决方案负责人郑重将在 2026 年 QCon 上海站分享 Vidu 多模态大模型的工程实践,讨论视频生成如何从“生成一段可看的视频”走向多主体一致、可控分镜和实时交互的内容生产基础能力。

事件核心:发生了什么

2026 年 QCon 全球软件开发大会·上海站定于 10 月 22 日至 24 日举办,主题聚焦 Harness AI 时代的工程实践,覆盖 AI Native 架构、Agent Runtime、AI Infra、Data Systems、Agent 安全与可观测、具身智能与世界模型等 20 个专题,预计有 100 多位一线专家参与分享。

其中,“AIGC 内容工业化”专题邀请到生数科技解决方案负责人郑重,演讲题目为《AIGC 驱动的内容生产力变革——Vidu 多模态大模型的创新与实践》。根据公开信息,他将围绕五条技术线索展开:多主体与长时序一致性、参考驱动生成、镜头与叙事控制、Vidu S1 流式视频生成的实时交互,以及世界行动模型方向的探索。郑重有 16 年 AI 大模型与多模态应用经验,曾任字节跳动解决方案高级总监、百度智能云解决方案副总经理。

为什么重要

视频生成赛道目前的竞争焦点,正在从“能否生成”转向“能否稳定、可控、可规模化地产出”。图像生成时代,单帧质量的提升相对容易评估;进入视频后,角色漂移、场景断裂、动作不连贯、镜头语言缺失等问题会被放大,直接影响 AI 短剧、广告素材、社交数字人等场景能否真正交付。

Vidu 提出的参考驱动生成、智能分镜和流式生成,对应的正是专业内容生产中的三个硬约束:一致性、可控性和实时性。如果这些能力成熟,视频大模型就不再只是创意工具,而更接近一条可接入生产流水线的基础设施。这也解释了为什么 QCon 会把“AIGC 内容工业化”单独设为专题。

对用户/开发者/创作者的影响

对创作者而言,参考生视频和主体保持能力意味着同一角色、商品或场景可以跨镜头复用,减少反复抽卡和后期修补的成本;智能分镜和运镜规划则把脚本理解、镜头调度纳入模型能力范围,AI 短剧的工业化流程会更接近传统影视分工。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对开发者而言,流式视频生成如果做到秒级响应和双向感知,交互式应用的形态会发生变化——实时数字人、可打断的 AI 导购、互动叙事类产品都可能出现新的 API 调用方式。对企业采购方来说,判断视频大模型是否可用,指标会从单条 Demo 的观感,转向一致性保持率、推理成本、并发响应和可控性。

值得关注的后续

一是 Vidu S1 流式生成的实际响应延迟和互动时长上限,目前公开信息显示仍以大会分享为主,缺少可核验的基准数据。二是参考驱动生成在长镜头、多主体场景下的稳定性是否达到可交付水平。三是世界行动模型与具身智能的结合,会停留在技术演示还是进入具体产品路线。

来源:InfoQ CN

celebrityanime
celebrityanime
文章: 26415

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注