概览
ElevenLabs 当前的旗舰语音合成模型,模型 id 为 eleven_v3,官方定位是「情感最丰富、最具表现力」的一档,擅长角色对白、有声书与需要情绪层次的内容。同系列还有更稳的长文本模型 Eleven Multilingual v2(29 种语言、单次 10000 字符)与低延迟的 Eleven Flash v2.5(32 种语言、约 75ms 延迟、单次 40000 字符、每字符成本低一半);旧的 Turbo v2.5 / v2 已被 Flash 系列取代。
- 模态
- 音频
能力
- 支持 70 多种语言的高表现力语音合成
- 单次请求上限 5000 字符,约 5 分钟音频
- 多说话人自然对话,配套 Text to Dialogue API
- audio tags:用标签细粒度控制情绪与演绎方式
- 实时变体 Eleven v3 Conversational 延迟约 280ms,适合语音智能体

