Flux 3 X Mimic:下一代视频动作模型

Black Forest Labs 发布了多模态基础模型 FLUX 3,并联合机器人公司 mimic robotics 推出了视频动作模型 FLUX-mimic。该模型基于同一骨干网络同时支持视频生成与机器人动作预测,并且已在奥迪生产线上测试部署。

Flux 3 X Mimic:下一代视频动作模型

一句话看懂:Black Forest Labs 发布了多模态基础模型 FLUX 3,并联合机器人公司 mimic robotics 推出了视频动作模型 FLUX-mimic。该模型基于同一骨干网络同时支持视频生成与机器人动作预测,并且已在奥迪生产线上测试部署。

事件核心:发生了什么

Black Forest Labs(BFL)公布了其最新多模态基础模型 FLUX 3 的早期版本,该模型从训练之初就联合学习了图像、视频和音频。相比此前只生成图像的 FLUX 1 和 FLUX 2,FLUX 3 能够联合生成视听内容,并在此基础上支持动作预测。

BFL 与机器人公司 mimic robotics 合作,基于 FLUX 3 的骨干网络开发了 FLUX-mimic——一个专为通用操作任务设计的视频动作模型。该模型已在 mimic 的全栈部署系统中集成,并实际在奥迪的生产线上进行测试和部署。

训练数据方面,BFL 透露视频预测占据了 FLUX 3 训练总计算成本的 95% 以上,而音频仅占不到 0.5% 的 token 量。当在训练课程中加入动作预测时,FLUX 3 的视频生成质量初期下滑约 10%,但在 3500 步训练后,模型恢复了全部视频生成能力并同时学会了动作预测。

为什么重要

这一成果从技术路线上挑战了“内容生成”与“具身智能”分属不同领域的传统观点。BFL 的核心论点在于:一个能生成逼真视频的模型,必然已经学习了接触、运动、重量、因果等物理世界规律。动作预测不是新的能力分支,而是同一世界模型在另一个低维表示上的映射。

这意味着基础模型的训练目标可以从图像/视频生成自然延伸至物理世界的控制与行动。对于 AI 行业而言,这降低了“具身智能”模型独立训练的成本,并可能推动视觉基础模型公司向机器人领域扩展。同时,奥迪作为早期工业客户,标志着该技术已从实验室进入真实生产线,具备商业化打样意义。

对用户/开发者/创作者的影响

对内容创作者而言,FLUX 3 的多模态能力意味着同一模型可以同时处理生成视频和匹配音频,降低不同工具之间的拼接成本。对机器人开发者而言,FLUX-mimic 提供了一个可能无需从零训练专用模型的路线——可直接利用预训练视觉世界模型来学习动作控制,未来可能降低机器人培训的数据和算力门槛。对企业用户,特别是制造业和自动化领域,FLUX-mimic 在奥迪的部署案例表明,视觉理解与动作执行的深度融合正逐步进入工业落地阶段,需关注其部署成本与集成难度。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是 FLUX 3 作为多模态基础模型是否会开放 API 或开源,这将影响开发者能否自行接入其动作预测能力。二是目前公开信息显示 FLUX-mimic 仍处于早期合作阶段,其是否能在更多工厂场景中稳定运行、成本是否可控,需要后续实际部署数据验证。三是竞品动向:OpenAI 的 Sora、谷歌的 Gemini 等同样在构建世界模型,BFL 的这一路径是否会引发更多视觉基础模型公司向具身智能领域延伸,值得持续跟踪。

来源:Hacker News

celebrityanime
celebrityanime
文章: 15099

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注