
一句话看懂:黑森林实验室(Black Forest Labs)推出了全新的多模态基础模型FLUX3,该模型采用统一架构,可一次性生成最长20秒的视频及原生同步音频,并在人工评测中取得了显著优于Grok Imagine Video和Seedance的胜率,标志着视频生成领域从纯视觉向“音画同步”多模态输出的重要跃迁。
事件核心:发生了什么
黑森林实验室于7月24日以Early Access模式发布了FLUX3。该模型基于自研的Self-Flow(自监督流匹配)学习框架,对图像、视频和音频进行联合训练,实现了多模态的统一处理。FLUX3支持文本生成视频、图像生成视频、视频生成视频、输入视频与音频续写、关键帧生成视频、多语言对话以及多镜头视频拼接等多种创作模式。在针对10秒、720p带声音视频的人工评测中,FLUX3对阵Grok Imagine Video的胜率达到69%,相对Seedance 2.0与Gemini Omni Flash的胜率为52%,显示出全面且直观的领先优势。
为什么重要
FLUX3的发布打破了此前视频生成模型普遍“无声”或需后期配音的局面。其原生同步音频输出能力,大幅降低了从单帧图像、短文本到可发布级音视频内容的生产门槛。从技术路线看,FLUX3的“统一架构+自监督流匹配”路径,挑战了当前多模态模型“分步拼接”的主流做法,可能加速行业向联合训练方向演进。在竞争格局上,FLUX3的胜率数据直接对话xAI的Grok Imagine Video和Runway的Seedance系列,表明黑森林实验室在多模态生成底座上的竞争力正在快速上升,且已开始切入机器人行为预测等下游场景,拓展了模型的应用边界。
对用户/开发者/创作者的影响
对于创作者,FLUX3意味着可以“一键生成”一段最长20秒、带原生音频的视频,省去了剪辑、配音、音画同步等环节,特别适合短视频、广告片和社交内容的生产。对于开发者,FLUX3提供了多模态API调用的可能,能更高效地构建需要音画联动的应用,如虚拟主播、交互式故事生成、教育演示等。对于企业用户,该模型在视频理解、声音合成及机器人行为预测上的潜力,有望降低在数字人、智能客服和工业仿真场景中的开发成本。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
目前公开信息显示,FLUX3处于Early Access阶段,具体的开放时间、定价策略以及API的使用门槛尚未完全公布。值得观察的点包括:一是该模型是否会在近期扩大公共访问范围,尤其是对比Grok和Seedance的免费/付费策略;二是竞品是否会快速跟进“原生音频同步”能力,形成新一轮功能标准;三是FLUX3在中文或多语言场景下的实际表现,以及黑森林实验室如何平衡模型能力与算力成本。此外,需要关注其开源计划或社区生态建设,因为这将直接影响开发者的迁移意愿。
来源:AIbase


