
一句话看懂:德国 AI 初创公司黑森林实验室(Black Forest Labs)发布了 Flux3,这是首个原生支持音频生成的多模态基础模型,能以一次推理方式输出最长 20 秒的音画同步内容,在评测中胜过了多家头部竞品。这意味着多模态模型首次将“听”和“看”完整融合到一个统一底座中。
事件核心:发生了什么
7 月 24 日,黑森林实验室正式发布 Flux3。该模型基于自研 Self-Flow 架构,拆分为图像、视频、音频和动作四套专用编解码器。与过去先合成视频再拼接音频的两阶段方法不同,Flux3 直接从模型层原生生成音频信号,输出支持最多 20 秒的同步音视频片段。功能覆盖文本/图像/视频到视频转换、关键帧过渡及多人对话场景。在早期评测中,以 720p 分辨率、10 秒长度设为基准,Flux3 以 93% 胜率击败 Luma Ray3.2,以 77% 优势超过 Runway Gen-4.5,甚至与 Seedance2.0 和 Gemini Omni Flash 对比时仍保留微弱优势。
此外,黑森林实验室与机器人公司 Mimic Robotics 合作开发了动作模型 Flux-mimic,已在奥迪工厂执行产线任务测试。发布节奏上,视频版本 Flux3Video 已上线,图像模型 Flux3Image 及开源权重版 Flux3Dev 将在近期发布。
为什么重要
Flux3 是第一个将音频生成嵌入多模态基础模型内部而非后处理的方案。它直接影响了 AI 视频生成行业的技术路线:以往主流方案(如 Runway、Luma)依赖独立音频管线,容易出现口型不对、环境音脱节等“音画异步”问题。Flux3 原生一次成型,理论上能更好保持时序一致性。对于黑森林实验室自身,这款模型标志着其从图像生成(Flux1)进入了多模态大模型赛道,也推出了通向工业应用的机器人动作模型,让“基础模型+行业适配”的商业模式更清晰。从竞争格局看,这一产品直接对标 Google 的 Gemini Omni Flash 和国内厂商的 Seedance2.0,且在该批次评测中占优。
对用户/开发者/创作者的影响
视频与内容创作者:如果直接使用 Flux3 生成视频,将省去单独配声、对齐音频的后期流程,20 秒以内的短视频、动画、虚拟角色对话制作效率有望显著提升。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
开发者和 API 用户:目前公开信息显示,Flux3Video 已可直接使用,后续 Flux3Image 和开源版本 Flux3Dev 会进一步降低接入门槛。开发者可重点关注其同步质量、推理成本及是否开放控制音频风格的能力。
行业客户:与 Mimic 合作的 Flux-mimic 已经进入 Audi 工厂测试,说明黑森林实验室在工业视觉+运动控制方向已有产品化尝试,对制造业自动化演示和机器人 learning by watching 场景有实际参考价值。
值得关注的后续
1)开源权重版 Flux3Dev 何时发布?目前只承诺“近期”,权重公布将直接影响社区适配和第三方应用生态的繁荣程度。2)20 秒时长是模型能力上限还是商业化分层?未来是否会推出更长时长或更高分辨率版本,定价方案尚未公开。3)竞品是否会在音画同步赛道跟进?Luma 和 Runway 是否会在下一代模型中增加原生音频模块,或继续维持后处理路线,这将成为评测音频质量的关键胜负手。
来源:AIbase


