概览
MiniMax 于 2026 年 1 月 23 日发布的语音合成模型。这一代的核心思路是「不要太完美」——通过原生的声音标签补上停顿、换气与口语填充词,让合成语音听起来更接近真人而不是播音腔。声音克隆只需约 10 秒素材即可复刻音色与说话节奏,音质则以录音棚级清晰度与噪声消除为目标;跨语种方面官方以中日语音对为首个优化方向,后续会扩展到更多语言组合。
- 模态
- 音频
能力
- 原生 sound tag:可生成停顿、换气与「嗯」「啊」这类语气词
- 10 秒样本即可完成高保真声音克隆,保留音色、气声与语速习惯
- 录音棚级清晰度,自带噪声消除
- 跨语种表现提升,率先优化中日语音对
