概览
S2.1 Pro 是 Fish Audio 当前的主力语音合成模型,官方称其为「表现力最强、情感最可控的实时语音模型」,在控制力与表现力维度自评第一,主打超低延迟。能力上支持愤怒、悲伤、兴奋、耳语等情感标签,以及笑声、抽泣、背景音等特效音,覆盖 30 多种语言,平台可用音色超过 200 万个。2026 年 6 月 23 日官方博客宣布 S2.1 Pro 面向开发者免费开放 API(「Free Text-to-Speech API for Developers」),随后在 7 月 23 日发文解释了背后的工程优化。订阅档位为:Free 0 美元/月(8000 积分,约 7 分钟)、Plus 5.5 美元/月或 66 美元/年(25 万积分,约 200 分钟)、Pro 37.5 美元/月或 450 美元/年(200 万积分,约 1620 分钟、3 个团队席位)、Max 749 美元/月或 8988 美元/年(2500 万积分,约 6250 分钟、10 个席位)、Enterprise 定制(零数据留存、私有化部署、SOC2 合规)。官方 FAQ 说明每分钟生成约消耗 600–625 积分,月度额度不结转,商用需使用付费套餐与已验证音色。Fish Audio 的上一代 S2 已开源。
- 模态
- 音频
能力
- 实时语音合成,超低延迟
- 情感标签控制:愤怒、悲伤、兴奋、耳语等
- 特效音支持:笑声、抽泣与背景音
- 覆盖 30 多种语言,含中、英、日、韩、法、德、阿、西等
- 平台可用音色超过 200 万个,支持音色克隆

