Black Forest Labs 发布 FLUX 3 多模态模型,支持单次生成 20 秒视频与原生音频

Black Forest Labs 于 2026 年 7 月 23 日以 Early Access 形式推出 FLUX 3 多模态基础模型,首次将图像、视频和音频统一到一个训练框架中,支持单次生成最长 20 秒的带原生音频视频,并已在视频生成人工评测中超过 Grok Imagine Video 等竞品。

Black Forest Labs 发布 FLUX 3 多模态模型,支持单次生成 20 秒视频与原生音频

一句话看懂:Black Forest Labs 于 2026 年 7 月 23 日以 Early Access 形式推出 FLUX 3 多模态基础模型,首次将图像、视频和音频统一到一个训练框架中,支持单次生成最长 20 秒的带原生音频视频,并已在视频生成人工评测中超过 Grok Imagine Video 等竞品。

事件核心:发生了什么

Black Forest Labs 昨日(7 月 23 日)正式发布 FLUX 3 多模态模型,采用名为 Self-Flow 的自监督流匹配学习框架,将图像、视频和音频的生成能力整合到单一架构中。FLUX 3 并非简单升级,而是在前几代(FLUX.1 和 FLUX.2)图像、视频生成基础上,首次加入了原生音频生成能力。模型支持多种输入方式:文本生成视频、图片生成视频、视频生成视频、输入视频与音频续写、关键帧转视频,以及多语言对话与多镜头串联。官方称可在单次生成中输出最长 20 秒、720p 分辨率的视频,且自带音频。在人工评测中,FLUX 3 对比 Grok Imagine Video 胜率为 69%,对比 Seedance 2.0 和 Gemini Omni Flash 的胜率均为 52%。此外,Black Forest Labs 正在与机器人公司 Mimic Robotics 合作,探索将 FLUX 3 用于机器人行为预测,图像能力方面也涵盖图像生成与编辑。

为什么重要

FLUX 3 的推出展示了一条“统一多模态生成”的技术路线:用同一模型同时处理图像、视频、音频三大模态,且能通过自监督学习框架进行同步训练。这与其他厂商多采用“组合多个单模态模型”的思路不同,可能降低多模态内容的生成成本和推理延迟。在视频生成领域,带有原生音频是当前主流竞品(如 Sora、Gemini 等)尚未完全解决的痛点,FLUX 3 在这一方向上的早期评测胜率数据(69% vs Grok Imagine Video)具有一定参考价值。同时,与机器人领域的合作暗示多模态模型正从内容生成向物理世界理解延伸,这可能影响未来具身智能的训练方式。

对用户/开发者/创作者的影响

对于内容创作者,FLUX 3 提供一站式视频+音频生成能力,20 秒的时长在短视频、广告、社交媒体素材制作中具备实用性。创作者目前可通过 Early Access 渠道试用。对于开发者,该模型的 API 接口若开放,将允许开发者用一套模型实现图文音视频的生成与编辑,减少模型调用和组合工作的复杂度。但需注意,FLUX 3 目前是部分公开的 Early Access 版本,具体定价、商用许可、生成稳定性尚待进一步披露。目前公开信息显示,Black Forest Labs 并未明确开源计划,这意味着开发者需要关注其 API 定价和调用限制。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

接下来应主要观察三个方面:第一,FLUX 3 的 Early Access 是否会在 2026 下半年转为正式发布,以及其 API 定价策略——如果价格合理且生成质量稳定,可能冲击现有视频生成服务(如 Runway、Pika 等)的市场格局。第二,原生音频效果的真实水平,目前宣称的“原生音频”在评测中并未专门披露音质、同步精度等指标,需等待第三方独立测试结果。第三,Black Forest Labs 与 Mimic Robotics 的机器人实验能否在 2026-2027 年产出可量化成果,这将验证多模态模型在物理世界中的价值不止于内容生成。

来源:IT之家(RSS)

celebrityanime
celebrityanime
文章: 15050

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注