Fish Audio S2.1 Pro

厂家 / 系列
Fish AudioFish Speech
上下文
输入价
输出价
许可
闭源

快速对比

Fish Audio S2.1 Pro 固定为第一列,选择一个候选即可并列查看关键规格。

查看 Fish Speech 系列对比

COMPARE MATRIX · 横向比较

模型比较

并列查看 0模型的关键规格

当前不足 2 项,可关闭面板后继续选择。

已选模型规格比较矩阵
比较项
规格暂无可比较规格
提示:左右滚动可查看全部项目

概览

S2.1 Pro 是 Fish Audio 当前的主力语音合成模型,官方称其为「表现力最强、情感最可控的实时语音模型」,在控制力与表现力维度自评第一,主打超低延迟。能力上支持愤怒、悲伤、兴奋、耳语等情感标签,以及笑声、抽泣、背景音等特效音,覆盖 30 多种语言,平台可用音色超过 200 万个。2026 年 6 月 23 日官方博客宣布 S2.1 Pro 面向开发者免费开放 API(「Free Text-to-Speech API for Developers」),随后在 7 月 23 日发文解释了背后的工程优化。订阅档位为:Free 0 美元/月(8000 积分,约 7 分钟)、Plus 5.5 美元/月或 66 美元/年(25 万积分,约 200 分钟)、Pro 37.5 美元/月或 450 美元/年(200 万积分,约 1620 分钟、3 个团队席位)、Max 749 美元/月或 8988 美元/年(2500 万积分,约 6250 分钟、10 个席位)、Enterprise 定制(零数据留存、私有化部署、SOC2 合规)。官方 FAQ 说明每分钟生成约消耗 600–625 积分,月度额度不结转,商用需使用付费套餐与已验证音色。Fish Audio 的上一代 S2 已开源。

模态
音频

能力

  • 实时语音合成,超低延迟
  • 情感标签控制:愤怒、悲伤、兴奋、耳语等
  • 特效音支持:笑声、抽泣与背景音
  • 覆盖 30 多种语言,含中、英、日、韩、法、德、阿、西等
  • 平台可用音色超过 200 万个,支持音色克隆

使用该模型的工具

浏览全部工具