概览
MiniMax 于 2026 年 8 月 13 日发布的开放权重音乐模型。它不把生成拆成写词、编曲、合成几步,而是从创意概念(歌词可选)一次产出成品歌曲。架构上由三部分组成:八层残差矢量量化(RVQ)tokenizer(1 个 16384 条目的语义码本 + 7 个 1024 条目的声学码本)、由 8B Global LLM 与 0.6B Local LLM 组成的 Hybrid-LM,以及 2.4B flow matching 加 123M Flow-VAE 解码器的合成栈;官方强调其方法论是通过结构化描述理解创作者的表达意图,而不是简单响应提示词。
- 模态
- 音频
- 参数量
- 8B(Global LLM)+ 0.6B(Local LLM)
能力
- 一次生成完成作曲、编曲、演唱与后期的整首歌
- 单次最长 5 分钟,32kHz / 16bit 立体声输出
- 人声自然度与长段编曲的连贯性提升
- 分层音频建模带来更好的音质
- 官方演示覆盖中文、英文与多语种内容
版本历史
3.0
- 开放权重发布,单次生成最长 5 分钟的完整歌曲
- 人声自然度、编曲连贯性与音质均有提升
