一句话看懂:MiniMax 今天发布通用多模态模型 H3,首次把文本、图像、视频和音频的理解与生成放进同一个模型,2K 视频生成成本不到主流方案三分之一,官方还宣布即将开源权重,这会直接影响视频生成领域的竞争格局。
事件核心:发生了什么
MiniMax 于 2026 年 7 月 31 日正式发布通用多模态生成模型 MiniMax H3。这是该公司第一次将文本、图像、视频和音频统一到单一模型中进行理解和生成,打破了视频生成领域长期存在的任务与模态割裂状态。H3 支持原生双通道音视频输出,最高可生成 15 秒的 2K 分辨率内容。
官方介绍显示,H3 引入了上下文全模态表征(Contextual Omni Representation)技术,让自然语言成为连接各模态的通用桥梁。用户可以用一句话描述复杂关系,例如“参照某视频的希区柯克式运镜,让指定图像中的人物演唱某段音频的旋律”,模型会自动完成理解与生成链路。配合自研的 H3-VAE 和 In-context Regeneration 技术,H3 在 2K 分辨率下的每秒生成成本不到主流模型的三分之一,768P 分辨率下不到一半。
在早期邀请测试中,H3 在指令遵循、品牌信息呈现、V2V 动作迁移等场景表现出商业级稳定性,已可用于广告、电商、游戏、UI 设计等领域。MiniMax 还宣布,将在遵守相关法律法规的前提下于近日开源 H3 模型权重,这是国内大型视频生成模型首次向社区开放权重。
为什么重要
视频生成行业过去由闭源模型主导,单个模型往往只擅长某一种或几种模态任务,用户需要拼接多个工具才能完成一条内容。H3 把音频、视频、图像和文本放进



