黑森林实验室发布Flux3 多模态模型 首次支持 20 秒原生音视频同步生成

德国AI初创公司黑森林实验室(Black Forest Labs)于7月23日发布多模态基础模型Flux3,首次实现原生音频与视频同步生成,最长可达20秒。这一技术突破意味着AI视频生成从单纯“画面模拟”迈入“音画一体”阶段,可能重新定义视频内容生产与机器感知能力。

黑森林实验室发布Flux3 多模态模型 首次支持 20 秒原生音视频同步生成

一句话看懂:德国AI初创公司黑森林实验室(Black Forest Labs)于7月23日发布多模态基础模型Flux3,首次实现原生音频与视频同步生成,最长可达20秒。这一技术突破意味着AI视频生成从单纯“画面模拟”迈入“音画一体”阶段,可能重新定义视频内容生产与机器感知能力。

事件核心:发生了什么

Flux3基于自研Self-Flow架构,集成了独立的图像、视频、音频和运动编解码器,实现了对物理与数字环境的统一理解与生成。作为首个原生支持音频生成的AI视频模型,它能直接输出最长20秒的音视频同步片段,覆盖文本/图像/视频到视频的转换、关键帧过渡及多语言对话等功能。在720p分辨率、10秒片段的早期测试中,Flux3以93%的胜率显著领先Luma Ray3.2,并以77%胜率击败Runway Gen-4.5,与Seedance2.0和Gemini Omni Flash等顶级模型相比也保持微弱优势。此外,公司还联合Mimic Robotics推出了用于机器人领域的视频动作模型Flux-mimic,该模型已在奥迪工厂开始生产任务测试。BFL采用分阶段发布策略:Flux3Video现已可用,Flux3Image和开源权重版本“Flux3Dev”将在近期发布。

为什么重要

此前主流的视频生成模型(如Sora、Runway、Luma)均不支持原生音频输出,用户需通过后期工具或第三方模型将音频与视频对齐,这带来了时间同步误差、对话情感错位等痛点。Flux3通过自研音频编解码器实现了端到端的音画协同,从技术路线上解决了单模态信息割裂问题。这一进展在商业化上意义明显:视频创作者可直接获得带有环境音、人物对话或背景音乐的成品,无需后期合成;在机器人领域,Flux-mimic证明了多模态生成模型可被用于工业环境中的动作规划与任务执行,这为AI从“视频工具”走向“物理世界模型”提供了工程落实验证。从竞争格局看,Flux3的测试成绩已超越多家头部玩家,开源版本(Flux3Dev)即将推出,这给了后续开发者一个低成本入场的可选路径。

对用户/开发者/创作者的影响

内容创作者: 视频制作效率将大幅提升。过去制作一段带有自然音效或对白的短视频,通常需分步完成画面生成、后期配音、对齐时间轴。Flux3可一次性输出同步片段,尤其适合社交媒体短内容、广告片、教学动画等场景。但需注意,目前20秒时长仍是上限,长视频仍依赖分段拼接。
开发者与开源社区: 随着开源版Flux3Dev的放出,个人开发者和小型团队有望在本地或云服务器上部署该模型,可尝试二次开发如实时视频通话、AI主播或游戏NPC对话系统。但具体推理成本、显存需求和API定价尚未公布,目前不宜盲目投入。
企业与工业用户: 奥迪工厂引入Flux-mimic进行生产测试,表明多模态生成模型已具备从桌面走向产线的能力。对汽车、仓储、机器人厂商而言,可关注其动作指令理解与物理环境交互的稳定性。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

第一,Flux3Image和开源权重的具体发布日期及参数量级,这将直接影响社区能否快速跟进复现与定制;第二,API定价策略以及是否提供音频独立生成能力,这关系到创作者是否愿意从现有工具链迁移;第三,Luma、Runway等竞争对手是否会在短时间内集中补足原生音频能力,以缩短性能差距,进而引发新一轮“音画同步”技术竞赛。目前公开信息显示,黑森林实验室尚未公布Flux3的算力消耗与推理延迟数据,这部分信息对实际落地性能判断至关重要。

来源:AIbase

celebrityanime
celebrityanime
文章: 15020

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注