
一句话看懂:德国AI初创公司黑森林实验室(Black Forest Labs)正式发布多模态基础模型Flux3,支持原生音频生成和最长20秒的同步音视频输出,在评测中对部分竞品取得了显著优势,并已开始向机器人领域拓展应用。
事件核心:发生了什么
据AIbase报道,德国AI初创公司黑森林实验室(Black Forest Labs)于2026年7月24日正式发布了其多模态基础模型Flux3。该模型基于“Self-Flow”架构,集成了专门的图像、视频、音频和运动编码器,能够统一理解和生成物理与数字环境的表征。作为业内首批支持原生音频生成的模型之一,Flux3可以一次性输出最长20秒、音视频同步的内容,并涵盖文字/图像/视频生成视频、关键帧转场及多语言对话等功能。在720p分辨率、10秒时长的早期测试中,Flux3以93%的胜率超越Luma Ray3.2,以77%的胜率大幅优于Runway Gen-4.5,并对Seedance 2.0和Gemini Omni Flash等顶尖模型保持略微优势。目前Flux3的视频生成功能已开放,而图像生成及开源权重版“Flux3 Dev”将在近期发布。
为什么重要
黑森林实验室是知名图像生成模型Stable Diffusion核心团队创立的创业公司,Flux系列之前已在图像生成领域获得广泛关注。此次Flux3的发布,进一步将竞争从静态图片和无声视频扩展到原生音频与同步输出层面。这一进展不仅意味着多模态大模型正趋于“一模型搞定所有内容形态”,更表明AI生成视频正从“视觉合成”走向“视听一体”的全新阶段。同时,Flux3在评测中的优异表现,尤其是在原生音频能力上的突破,对现有视频生成领域的主流厂商(如Runway、Luma)构成了实质性竞争压力。此外,公司已与Mimic Robotics合作开发视频动作模型“Flux-mimic”,并在奥迪工厂启动生产任务测试,标志着多模态模型的能力正从数字内容创作延伸至物理世界的操控与制造场景。
对用户/开发者/创作者的影响
对于内容创作者而言,Flux3的20秒长片段、原生音频同步生成能力将显著降低视频制作门槛,同时生成高质量配音和对口型内容,有望直接应用于广告、影视预可视化及短视频创作。对开发者来说,开源版本的“Flux3 Dev”将在后续释出,意味着可在本地或私有环境进行微调和推理,不必完全依赖API,这对控制成本和定制模型尤为关键。企业用户,尤其是涉及虚拟人、直播带货、工业培训视频等场景,可能受益于模型在语音和动作耦合方面的统一处理。在机器人行业的探索,则提示AI模型厂商与制造企业的协同正在加深,未来可能催生新的“视觉-语言-动作”一体化服务。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
首先,Flux3的图像生成功能和开源权重版“Flux3 Dev”的具体参数、许可协议与发布日期值得密切跟踪,这直接决定开发者能否快速上手。其次,Runway、Luma等竞品是否会迅速跟进原生音频生成能力,以及视频质量和推理成本的变化,将深刻影响市场格局。最后,黑森林实验室与奥迪工厂的实验能否规模化落地,将检验多模态AI模型从生成内容到控制物理动作的真实可行性,这也是投资人判断BFL商业化路径的重要依据。
来源:AIbase


