MiniMax发布通用全模态模型H3,15秒2K音视频生成价格不到主流模型三分之一

MiniMax 今天发布通用多模态模型 H3,首次把文本、图像、视频和音频的理解与生成放进同一个模型,2K 视频生成成本不到主流方案三分之一,官方还宣布即将开源权重,这会直接影响视频生成领域的竞争格局。

一句话看懂:MiniMax 今天发布通用多模态模型 H3,首次把文本、图像、视频和音频的理解与生成放进同一个模型,2K 视频生成成本不到主流方案三分之一,官方还宣布即将开源权重,这会直接影响视频生成领域的竞争格局。

事件核心:发生了什么

MiniMax 于 2026 年 7 月 31 日正式发布通用多模态生成模型 MiniMax H3。这是该公司第一次将文本、图像、视频和音频统一到单一模型中进行理解和生成,打破了视频生成领域长期存在的任务与模态割裂状态。H3 支持原生双通道音视频输出,最高可生成 15 秒的 2K 分辨率内容。

官方介绍显示,H3 引入了上下文全模态表征(Contextual Omni Representation)技术,让自然语言成为连接各模态的通用桥梁。用户可以用一句话描述复杂关系,例如“参照某视频的希区柯克式运镜,让指定图像中的人物演唱某段音频的旋律”,模型会自动完成理解与生成链路。配合自研的 H3-VAE 和 In-context Regeneration 技术,H3 在 2K 分辨率下的每秒生成成本不到主流模型的三分之一,768P 分辨率下不到一半。

在早期邀请测试中,H3 在指令遵循、品牌信息呈现、V2V 动作迁移等场景表现出商业级稳定性,已可用于广告、电商、游戏、UI 设计等领域。MiniMax 还宣布,将在遵守相关法律法规的前提下于近日开源 H3 模型权重,这是国内大型视频生成模型首次向社区开放权重。

为什么重要

视频生成行业过去由闭源模型主导,单个模型往往只擅长某一种或几种模态任务,用户需要拼接多个工具才能完成一条内容。H3 把音频、视频、图像和文本放进

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

celebrityanime
celebrityanime
文章: 16166

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注