一句话看懂:LAION 发布了名为 Big Video Dataset(BVD)的开放视频数据集,包含约 1000 万小时、5500 万个剪辑片段,旨在为多模态 AI 研究提供大规模、可合法用于非商业研究的视频训练语料。
事件核心:发生了什么
8 月 29 日,非营利组织 LAION 宣布推出 Big Video Dataset(BVD)。该数据集从 CommonCrawl 中筛选出 13 亿条视频 URL,最终成功下载了其中 8000 万个视频,总时长约 1000 万小时。团队从中提取了 5500 万个视频片段,并为每个片段自动生成了视频与音频的文字描述,同时附带 3 亿张静态图像。
数据集以研究用途免费开放,代码与数据均已公开。据 LAION 发布的论文,基于 BVD 训练的模型在常见视频到文本基准测试上,比使用 InternVid 训练的对照模型最高提升 2.1 个百分点。该数据集的大部分视频来自 YouTube,内容以英语为主。
为什么重要
高质量视频数据集长期被科技巨头垄断,公开可获取的大规模视频语料稀缺,这直接限制了学术界和中小团队在多模态大模型领域的参与能力。BVD 的发布将视频、音频和文本三者对齐,有助于训练出更接近人类理解方式的视频-语言模型,推动视频理解、自动字幕生成、视频检索等方向的研究。
值得注意的法律背景是,LAION 引用 2024 年汉堡地区法院的裁决,允许其为非商业研究目的收集受版权保护的内容。这为研究机构使用大规模网络数据提供了案例参考,但该数据集仅限研究用途,不可用于商业模型训练。
对用户/开发者/创作者的影响
对学术研究者和独立开发者而言,BVD 提供了一个无需自行爬取海量视频、可直接用于实验的高质量训练资源,降低了视频多模态研究的入门门槛。对于使用开源模型做视频理解任务的开发者,BVD 可作为 InternVid、WebVid 等现有数据集的补充,用来提升模型在真实场景下的对齐能力。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
对视频创作者和内容平台而言,该数据集包含大量 YouTube 视频片段,尽管 LAION 强调应尊重原始创作者的权利,但创作者仍应关注自己的内容是否被纳入此类研究型数据集中。商业公司若计划将 BVD 用于产品化模型,目前公开信息显示其许可条款仅限研究用途,需要在合规上保持谨慎。
值得关注的后续
第一,BVD 能否在实际模型训练中持续展现出对 InternVid 的优势,尤其是在更大规模参数模型上的表现,尚待第三方复现验证。
第二,开放视频数据集是否会引发更多跟进者,例如类似规模的非英语视频数据集,或者针对特定领域(如教育、医疗)的垂直视频语料。
第三,版权争议并未完全平息。虽然汉堡法院的裁决为 LAION 提供了法律依据,但其他司法管辖区的法院、以及 YouTube 平台的自动化抓取政策,可能对数据集的持续更新和可复制性产生影响。


