简介
做语音合成、音色克隆与语音识别的平台,主打低延迟与情绪可控。旗舰模型 Fish Audio S2.1 Pro 面向实时场景:情绪与音效直接用 [angry]、[whispering]、[laughing] 这类标签写进文本控制,不必额外调参;音色克隆 15 秒素材即可高保真复刻。语言覆盖英语、日语、韩语、中文、法语、德语、阿拉伯语与西班牙语,标称 30+ 种,研究线还包括 S2、S1、Fish Speech、Fish Diffusion 与 OpenAudio。相比只做单一配音的工具,它把语音合成与语音转文字放在同一个 API 里,付费起步档每月,适合要把实时语音接进自己产品、又在意情绪表现与单价的开发者和内容团队。
- 旗舰模型Fish Audio S2.1 Pro,超低延迟的实时语音合成
- 情绪标签精细控制[angry]、[sad]、[excited]、[whispering] 等
- 音效标签[laughing]、[sobbing]、[pause] 等可直接写进文本
- 音色克隆15 秒素材即可高保真复刻任意声音
- 语音转文字STT 与语音合成在同一平台打通
- 多语覆盖英、日、韩、中、法、德、阿拉伯与西班牙语,标称 30+ 种
- 开放研究线S2、S1、Fish Speech、Fish Diffusion 与 OpenAudio
界面截图
可左右滑动,或使用方向键、Home 和 End 浏览截图。官网公开页面实拍 AI 生成概念界面 · 非官方截图 · www.kun.net
定价 · 套餐对比
免费版免费
- 累计最长 7 分钟生成
- 单次最多 500 字符
Plus$5.50/月
- 每月 250,000 额度
- 累计最长 200 分钟生成
- 单次最多 15,000 字符
Pro$37.50/月
- 每月 2,000,000 额度
- 累计最长 1,620 分钟生成
- 单次最多 30,000 字符
Max$749/月
- 每月 25,000,000 额度
- 累计最长 6,250 分钟生成
企业版定制
- 自定义 SSO(即将推出)
- 支持私有化部署
优缺点
优点
- 15 秒克隆音色,上手门槛极低
- 情绪与音效用文本标签直接控制,比调参直观
- Plus 档每月 $5.50 起,性价比在同类里突出
- 多语言覆盖广,中日韩欧语系都能用
缺点
- 免费档单次仅 500 字符,长文本必须付费
- 音色克隆涉及肖像与声音权利,商用需自行确认授权
- Max 档每月 $749,重度用量成本陡增
常见问题
- 克隆一个音色需要多少素材?
- 15 秒即可高保真克隆任意声音,官网原话是 "Clone Any Voice with perfect fidelity in 15 seconds"。
- 怎么控制语气和情绪?
- 直接在文本里写标签。情绪标签有 [angry]、[sad]、[excited]、[whispering] 等,音效标签有 [laughing]、[sobbing]、[pause] 等,无需额外参数调音。
- 支持中文吗?
- 支持。官网列出的语言包括英语、日语、韩语、中文、法语、德语、阿拉伯语与西班牙语,并标称多语支持 30 种以上。
- 免费额度够用吗?
- 免费档每月 8,000 额度、累计约 7 分钟生成、单次最多 500 字符,够做效果验证。规模化使用建议上 Plus(每月 $5.50,250,000 额度)或 Pro(每月 $37.50,200 万额度)。
替代品
同类可替代或互补的工具,可横向对比后选择。






