概览
Stable Audio 3.0 是 Stability AI 于 2026 年 5 月 20 日发布的音频模型家族,官方定位为「完全基于已授权数据训练、可作为音频社区基础设施」的模型。家族分三档:Large(企业级)、Medium(提供开放权重)、Small 与 Small SFX(面向移动端优化,同样提供开放权重)。能力上支持生成最长六分钟、具备复杂动态结构的完整曲目,也支持音效生成、片段修改与曲目延长,并可在用户自有素材库上做定制。交付方式包括企业授权自托管、Stability AI API 托管、开放权重下载(Small 与 Medium)以及 Stable Audio 网页应用。上一代 Stable Audio 2.5 发布于 2025 年 9 月 10 日,是首个面向企业规模化音频生产的版本。
- 模态
- 音频
能力
- 生成最长 6 分钟、具备复杂动态结构的完整音乐曲目
- 音效(SFX)生成,可用于影视与游戏音频
- 片段级编辑与曲目续写
- 可基于用户自有音频库做定制训练
- 全部训练数据均已获授权,商用合规性更清晰
版本历史
3.0
- 全新模型家族,分 Large / Medium / Small / Small SFX 四档
- Medium 与 Small 提供开放权重
- 完全使用已授权数据训练
2.5
- 首个面向企业规模化声音生产的版本
- 在音质与动态编曲控制上做提升

