概览
Seed-TTS 是字节跳动 Seed 团队的自回归语音合成模型家族,官方称其生成的语音「与真人语音几乎无法区分」,核心能力是从说话人样本做上下文学习。技术报告(arXiv:2406.02430)同时提出两种架构:基于语言模型生成语音 token 的自回归版 Seed-TTS,以及完全基于扩散、端到端生成且无需预估音素时长的 Seed-TTS_DiT。训练上采用自蒸馏做语音属性解耦,并用强化学习提升鲁棒性、音色相似度与可控性。演示场景包括多说话人有声书朗读与跨语种视频配音(配合口型编辑)。需要说明的是,截至 2026 年 8 月,字节 Seed 官网研究页展示的最新音频模型是 Seed Audio 1.0,Seed-TTS 更多作为其语音合成的技术基座而非单独对外的产品线。
- 模态
- 音频
能力
- 零样本音色克隆:给一段语音提示即可复刻说话人
- 情感控制:愤怒、开心、悲伤、温柔、困惑、恐惧
- 中英跨语种合成与视频配音(含口型同步编辑)
- 说话人微调与无需训练数据的音色转换
- 语音编辑:修改内容与语速

