一句话看懂:MiniMax 于 8 月 14 日发布音乐生成模型 Music3,输入歌词和音乐描述即可生成最长 5 分钟的完整歌曲。它用 8B 大模型管歌曲结构、0.6B 小模型补声音细节,试图解决长音频生成中主题漂移和结构缺失的行业难题。
事件核心:发生了什么
据 AIbase 报道,MiniMax 正式推出音乐生成模型 MiniMax-Music3。用户输入歌词和一段音乐风格描述,模型即可生成最长 5 分钟、32kHz、16-bit 的立体声 WAV 文件,覆盖前奏、主歌、副歌、桥段、间奏和尾声等完整歌曲结构。
模型采用分层自回归架构:负责全局的 Global LLM 参数规模为 8B,基于 Qwen3-8B 初始化,逐帧预测第一个 RVQ 码本,主要管理歌曲的长期语义与结构变化;负责局部的 Local LLM 仅有 0.6B 参数,用于预测剩余声学码本,填充音色、细节等细粒度声学信息。官方表示,这种“大模型定骨架、小模型补细节”的分工让模型在长音频中能稳定保持音乐主题、节奏、人声特征和编曲推进。目前模型页已上线 GitHub,并提供示例歌曲试听。
为什么重要
音乐生成赛道过去的普遍痛点,是生成时长拉长后容易出现结构松散、主题重复或人声漂移。Music3 将大模型集中在语义与结构建模上,再用小模型做声学细节补全,既是对长音频一致性的一次针对性技术尝试,也有助于控制训练和推理算力成本。值得注意的一点是,MiniMax 基于 Qwen3-8B 做初始化而非从零训练超大底座,说明高效复用已有开源大模型也是这类产品控制成本的一条可行路线。
同时,官方选择在 GitHub 公开



