Fish Audio

Fish Audio

15 秒克隆任意音色的实时语音模型

更新于 2026-09

  • 网页
  • API
产品概览
概览
分类AI 音频
平台网页 / API

简介

做语音合成、音色克隆与语音识别的平台,主打低延迟与情绪可控。旗舰模型 Fish Audio S2.1 Pro 面向实时场景:情绪与音效直接用 [angry]、[whispering]、[laughing] 这类标签写进文本控制,不必额外调参;音色克隆 15 秒素材即可高保真复刻。语言覆盖英语、日语、韩语、中文、法语、德语、阿拉伯语与西班牙语,标称 30+ 种,研究线还包括 S2、S1、Fish Speech、Fish Diffusion 与 OpenAudio。相比只做单一配音的工具,它把语音合成与语音转文字放在同一个 API 里,付费起步档每月,适合要把实时语音接进自己产品、又在意情绪表现与单价的开发者和内容团队。

  • 旗舰模型Fish Audio S2.1 Pro,超低延迟的实时语音合成
  • 情绪标签精细控制[angry]、[sad]、[excited]、[whispering] 等
  • 音效标签[laughing]、[sobbing]、[pause] 等可直接写进文本
  • 音色克隆15 秒素材即可高保真复刻任意声音
  • 语音转文字STT 与语音合成在同一平台打通
  • 多语覆盖英、日、韩、中、法、德、阿拉伯与西班牙语,标称 30+ 种
  • 开放研究线S2、S1、Fish Speech、Fish Diffusion 与 OpenAudio
语音合成音色克隆TTS实时语音多语言

界面截图

定价 · 套餐对比

免费版免费每月 8,000 额度
  • 累计最长 7 分钟生成
  • 单次最多 500 字符
Plus$5.50/年付 $66
  • 每月 250,000 额度
  • 累计最长 200 分钟生成
  • 单次最多 15,000 字符
Pro$37.50/年付 $450
  • 每月 2,000,000 额度
  • 累计最长 1,620 分钟生成
  • 单次最多 30,000 字符
Max$749/年付 $8,988
  • 每月 25,000,000 额度
  • 累计最长 6,250 分钟生成
企业版定制按量议价、年度结算
  • 自定义 SSO(即将推出)
  • 支持私有化部署

优缺点

优点
  • 15 秒克隆音色,上手门槛极低
  • 情绪与音效用文本标签直接控制,比调参直观
  • Plus 档每月 $5.50 起,性价比在同类里突出
  • 多语言覆盖广,中日韩欧语系都能用
缺点
  • 免费档单次仅 500 字符,长文本必须付费
  • 音色克隆涉及肖像与声音权利,商用需自行确认授权
  • Max 档每月 $749,重度用量成本陡增

常见问题

克隆一个音色需要多少素材?
15 秒即可高保真克隆任意声音,官网原话是 "Clone Any Voice with perfect fidelity in 15 seconds"。
怎么控制语气和情绪?
直接在文本里写标签。情绪标签有 [angry]、[sad]、[excited]、[whispering] 等,音效标签有 [laughing]、[sobbing]、[pause] 等,无需额外参数调音。
支持中文吗?
支持。官网列出的语言包括英语、日语、韩语、中文、法语、德语、阿拉伯语与西班牙语,并标称多语支持 30 种以上。
免费额度够用吗?
免费档每月 8,000 额度、累计约 7 分钟生成、单次最多 500 字符,够做效果验证。规模化使用建议上 Plus(每月 $5.50,250,000 额度)或 Pro(每月 $37.50,200 万额度)。

替代品

同类可替代或互补的工具,可横向对比后选择。

相关工具