Google DeepMind发布GenCeption:基于视频生成模型实现多项计算机视觉突破

Google DeepMind 推出名为 GenCeption 的新模型,利用预训练视频生成模型,仅靠约 7500 个合成视频的训练数据,在深度估计、图像分割和 3D 姿态识别等经典视觉任务上达到了与当前专用模型相当甚至更优的效果,展现了视频生成模型作为通用视觉基础模型的潜力。

Google DeepMind发布GenCeption:基于视频生成模型实现多项计算机视觉突破

一句话看懂:Google DeepMind 推出名为 GenCeption 的新模型,利用预训练视频生成模型,仅靠约 7500 个合成视频的训练数据,在深度估计、图像分割和 3D 姿态识别等经典视觉任务上达到了与当前专用模型相当甚至更优的效果,展现了视频生成模型作为通用视觉基础模型的潜力。

事件核心:发生了什么

7 月 20 日,Google DeepMind 发布了 GenCeption 模型。该模型基于阿里巴巴开源视频模型 Wan2.1 ,通过简化架构实现单次前向推理,即可根据文本提示在同一视频上生成深度图、表面法线、分割掩码和姿态估计结果,并支持通过可训练模块输出 3D 关键点等非图像任务。

在训练数据方面,GenCeption 主要使用基于 Blender 合成的包含 800 个人体模型与 200 个动作序列的 7500 个视频。研究显示,该模型在深度估计、表面法线预测、3D 姿态识别和语言引导分割等基准测试中表现优异,但训练数据量仅为现有某些模型的七分之一到百分之一。

此外,模型展现出较强的泛化能力——尽管训练数据主要来自单人合成人体视频,但它在多人、动物和类人机器人等真实场景中,也能为未见过的类别生成详细的视觉预测结果。

为什么重要

当前计算机视觉领域仍以任务专用模型为主,例如分割任务用 Segment Anything、深度估计用 Depth Anything,不同任务通常使用不同的架构。GenCeption 的工作表明,大型文本到视频模型在训练过程中学习到的场景空间结构、物体运动模式以及语言与视觉的关联能力,有可能被迁移为通用的视觉理解能力。这意味着视频生成模型正在从单纯的内容生成工具,向视觉理解基础模型的方向演进。

如果这条技术路线得到验证,可能降低计算机视觉领域的模型开发门槛——开发者不再需要为每个视觉任务分别训练、调优专用模型,而是可以基于一个通用视频模型进行任务扩展。

对用户/开发者/创作者的影响

对开发者:GenCeption 基于开源模型 Wan2.1 构建,代码和权重若后续开源,将降低视觉任务微调的成本。目前训练数据量远小于传统视觉模型,意味着开发者可以用更少的数据和算力尝试类似的多任务方案。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对内容创作者:模型支持文本引导的视觉预测,例如通过自然语言指令直接生成视频中特定物体的分割结果或深度信息,有望简化视频后期处理、3D 场景重建等创作流程。

对普通用户:短期影响有限,因为模型推理速度仍需优化(处理 81 帧视频约需 6-10 秒),且研究团队指出多任务联合训练会影响个别复杂任务的表现,产品化还需时间。

值得关注的后续

第一,GenCeption 是否会正式开源或提供 API 服务,以及开发者的上手成本如何,将直接影响其在行业内的采用速度。第二,推理速度优化是当前瓶颈,若未来能降至实时或准实时水平,可能替代部分专用模型的应用场景。第三,DeepMind 与阿里巴巴在 Wan2.1 上的合作模式,以及未来是否会有其他视频生成模型(如 Meta、字节跳动的模型)被用于类似的多任务视觉理解,值得跟踪。

来源:AIbase

celebrityanime
celebrityanime
文章: 14740

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注