一句话看懂:MiniMax 于 2026 年 7 月 31 日发布多模态生成模型 H3,支持文本、图像、视频、音频任意组合输入,输出带原生立体声的高清视频,并承诺数天内完全开源权重;2K 分辨率下每秒生成成本不到主流同类产品的三分之一。
事件核心:发生了什么
MiniMax H3 打破了多模态模型按任务拆分专家模型的传统做法,将文本生成图像、文本生成视频、图像生成视频和音频处理整合进同一个预训练框架,并引入 H3-Omni
MiniMax 于 2026 年 7 月 31 日发布多模态生成模型 H3,支持文本、图像、视频、音频任意组合输入,输出带原生立体声的高清视频,并承诺数天内完全开源权重;2K 分辨率下每秒生成成本不到主流同类产品的三分之一。
一句话看懂:MiniMax 于 2026 年 7 月 31 日发布多模态生成模型 H3,支持文本、图像、视频、音频任意组合输入,输出带原生立体声的高清视频,并承诺数天内完全开源权重;2K 分辨率下每秒生成成本不到主流同类产品的三分之一。
MiniMax H3 打破了多模态模型按任务拆分专家模型的传统做法,将文本生成图像、文本生成视频、图像生成视频和音频处理整合进同一个预训练框架,并引入 H3-Omni