Seed-TTS

厂家 / 系列
字节跳动Seed
上下文
输入价
输出价
许可
闭源

快速对比

Seed-TTS 固定为第一列,选择一个候选即可并列查看关键规格。

查看 Seed 系列对比

COMPARE MATRIX · 横向比较

模型比较

并列查看 0模型的关键规格

当前不足 2 项,可关闭面板后继续选择。

已选模型规格比较矩阵
比较项
规格暂无可比较规格
提示:左右滚动可查看全部项目

概览

Seed-TTS 是字节跳动 Seed 团队的自回归语音合成模型家族,官方称其生成的语音「与真人语音几乎无法区分」,核心能力是从说话人样本做上下文学习。技术报告(arXiv:2406.02430)同时提出两种架构:基于语言模型生成语音 token 的自回归版 Seed-TTS,以及完全基于扩散、端到端生成且无需预估音素时长的 Seed-TTS_DiT。训练上采用自蒸馏做语音属性解耦,并用强化学习提升鲁棒性、音色相似度与可控性。演示场景包括多说话人有声书朗读与跨语种视频配音(配合口型编辑)。需要说明的是,截至 2026 年 8 月,字节 Seed 官网研究页展示的最新音频模型是 Seed Audio 1.0,Seed-TTS 更多作为其语音合成的技术基座而非单独对外的产品线。

模态
音频

能力

  • 零样本音色克隆:给一段语音提示即可复刻说话人
  • 情感控制:愤怒、开心、悲伤、温柔、困惑、恐惧
  • 中英跨语种合成与视频配音(含口型同步编辑)
  • 说话人微调与无需训练数据的音色转换
  • 语音编辑:修改内容与语速