Flux 3可生成最长20秒原生音频视频,Black Forest Labs首次实现

德国AI公司Black Forest Labs发布Flux 3模型,首次在视频生成中同步输出原生音频,最长支持20秒。模型在早期测试中以较大优势胜过Luma、Runway等竞品,并已开始探索机器人控制等应用场景。

Flux 3可生成最长20秒原生音频视频,Black Forest Labs首次实现

一句话看懂:德国AI公司Black Forest Labs发布Flux 3模型,首次在视频生成中同步输出原生音频,最长支持20秒。模型在早期测试中以较大优势胜过Luma、Runway等竞品,并已开始探索机器人控制等应用场景。

事件核心:发生了什么

德国AI公司Black Forest Labs(BFL)于2026年7月23日正式发布Flux 3多模态基座模型。该模型的核心创新在于同时学习图像、视频和音频三种模态,并首次支持在视频生成中直接输出与画面匹配的原生音频,视频长度最长20秒。Flux 3支持文本生视频、图文生视频、视频转视频、关键帧过渡等多种生成方式,还能通过智能体驱动机制将多个片段链接成更长的多镜头序列。BFL宣称该模型在人脸表情和物理事件的音效匹配上表现突出。

在BFL自评的早期实验中(10秒720p视频),用户对Flux 3的偏好率显著高于多款竞品:比Luma Ray 3.2高93%,比Runway Gen-4.5高77%,比Grok Imagine Video高69%。面对更强的对手如Kling v3 Pro(60%)、Happy Horse v1(59%)、Seedance 2.0(52%)和Gemini Omni Flash(52%)时,优势有所收窄,但仍处于领先位置。不过BFL明确指出这些结果仅为初步,尚无第三方独立测试。

值得一提的是,BFL还联合Mimic Robotics推出了视频动作模型Flux-mimic,目前已在奥迪的生产任务中测试,用于机器人抓取、装配等操作控制。

为什么重要

这是文生视频领域向“世界模型”迈出的关键一步。传统视频模型只处理视觉,而Flux 3将音频作为原生输出,意味着模型需要理解声音与物理事件的对应关系(如关门声、物体碰撞),这比单纯生成画面更接近对真实世界的建模。BFL在技术细节中披露,模型基于Self-Flow方法训练,用多模态Transformer将图像、视频、音频和动作转化为共享内部表征,再反向解码为不同输出——这种统一学习范式在生成质量和物理世界理解上都优于传统的流匹配方法。

从竞争格局看,Flux 3的加入让视频生成头部玩家的竞争更加激烈。Seedance已进入好莱坞生态,Gemini Omni Flash来自谷歌,而BFL以开源思维(计划发布“Flux 3 Dev”开放权重版本)与商业化并行,可能会加速行业标准的分化。

对用户/开发者/创作者的影响

对内容创作者:视频和音频一并生成,省去了后期配音、音效匹配的繁琐步骤,尤其适合广告短片、社交内容、快剪需求。20秒长度覆盖了短视频平台的主流内容单元。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对开发者与AI爱好者:BFL计划分期推出各项能力——Flux 3 Video已可用,Flux 3 Image将在数周内进入早期访问,动作预测先面向合作伙伴。更关键的是,BFL承诺后续会以“Flux 3 Dev”名义开放多模态骨干的开放权重,这意味着二次开发、微调和社区创新将成为可能。

对机器人与工业领域:Flux-mimic的奥迪落地验证了“算法+硬件”的闭环——模型不仅生成内容,还能理解物理世界并输出动作指令。这为具身智能提供了一条从视觉理解到动作执行的训练路径。

值得关注的后续

1. 开放权重何时兑现?Flux 3 Dev的具体发布计划尚未明确,但开放策略将直接影响开发者生态的规模。

2. 独立第三方评测何时登场?BFL的自测数据亮眼,但缺乏外部验证。如果独立对比结果接近官方数据,Flux 3有望跻身第一梯队。

3. 机器人业务的扩展路径。Flux-mimic在奥迪的测试结果和应用范围尚未披露,但其作为“视频动作模型”的定位,可能吸引更多制造业客户尝试。

来源:The Decoder AI News

celebrityanime
celebrityanime
文章: 14938

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注