Stable Audio 是 Stability AI(Stable Diffusion 同名母公司)旗下的 AI 音乐与音效生成平台,2026 年 5 月 20 日正式发布 Stable Audio 3.0 模型家族——这是当前 AI 音乐生成赛道唯一”完全授权训练数据 + 开源权重 + 可自托管”的组合 。主打”文本生成乐器音乐、音效、声音景观,最长 6 分 20 秒,支持分轨输出、局部重绘(Inpainting)、LoRA 微调、开源自托管”。
产品概述
Stability AI 于 2026 年 5 月 20 日发布 Stable Audio 3.0 模型家族 ,包含 4 个变体 :
| 模型 |
参数量 |
最大时长 |
部署方式 |
适用场景 |
| 3.0 Small SFX |
459M diffusion + 108M SAME-S |
2 分钟 |
开源权重(Hugging Face) |
移动端/笔记本 CPU 实时音效生成 |
| 3.0 Small |
459M diffusion + 108M SAME-S |
2 分钟 |
开源权重 |
唯一能在端侧/离线生成完整乐曲的模型 |
| 3.0 Medium |
1.4B diffusion + 852M SAME-L |
6 分 20 秒 |
开源权重 |
开发者/生产环境默认选择 |
| 3.0 Large |
2.7B diffusion + 852M SAME-L |
6 分 20 秒 |
仅 API / 企业自托管 |
音乐平台/创意应用的高并发低延迟生成 |
架构突破——SAME 语义-声学自编码器:
- 压缩比 4096×(256 样本块 → 16× Transformer 重采样 → 256 维潜表示,约 10.76 Hz)
- 损失函数融合多分辨率 STFT 重建 + 相对论 GAN + 跨模态对比对齐 + 语义回归(色度、耳间电平差)——既保真声学细节,又捕获语义结构(乐句、和声、节奏模式)
- 这是 Medium/Large 能在 6+ 分钟内”不漂移成浆糊”的根本原因
推理速度(H200 GPU) :
- Small:0.45 秒生成 120 秒音乐
- Medium:0.78 秒生成 120 秒音乐
- Large:0.81 秒生成 120 秒音乐
- 8 步 ping-pong 采样,无需 CFG(分类器自由引导)——蒸馏热身阶段已将引导内化,推理速度约 2 倍提升
训练数据完全授权 :
- AudioSparx 贡献 806,284 首完全授权曲目
- Freesound 贡献 472,618 首 CC 授权音频(CC-0、CC-BY、CC-Sampling+)
- 总计 1,278,902 条音频
- UMG/WMG 合作是”未来工具开发伙伴”,其厂牌目录未进入 3.0 训练集——Stability AI 刻意将此作为企业销售卖点
典型工作流:
- 文本提示:输入详细描述,如”120 BPM acid-house break with rolling sub bass and analog synth pads, 90 seconds, build-up at 30s”
- AI 生成:SAME 编码 → 扩散模型潜空间去噪 → 变量时长解码为 44.1kHz 立体声波形
- 局部编辑:用 Inpainting 选择时间段重生成(单段/多段),或用 Causal Continuation 向前续写
- 风格迁移:Audio-to-Audio 上传参考音频 + 文本提示,做风格转换/变体生成
- 人声转换(Beta):上传人声录音 → AI 将其转换为音乐/音效(注意:这不是歌词演唱生成 )
- 分轨导出:付费套餐支持鼓/贝斯/旋律/FX 分轨,直接导入 Ableton/Logic Pro
- 微调(LoRA):Small/Medium 支持用自有音频库训练 LoRA 适配器
核心规格:
| 规格 |
Stable Audio 3.0 数值 |
| 平台 |
Web 网页端(stableaudio.com)、API(platform.stability.ai)、开源权重自托管 |
| 当前模型 |
Stable Audio 3.0 Small / Small SFX / Medium(开源)/ Large(API) |
| AI 架构 |
文本条件潜扩散 + SAME 语义-声学自编码器 + Transformer 主干 + 差分注意力(Medium/Large) |
| 输出采样率 |
44.1kHz 立体声 |
| 最大时长 |
Small 2 分钟 / Medium & Large 6 分 20 秒 |
| 时长粒度 |
per-second 变量时长,1 秒到 6:20 任意长度 |
| 生成速度 |
Small 0.45s/120s、Medium 0.78s/120s、Large 0.81s/120s(H200) |
| 推理步数 |
8 步 ping-pong 采样(对抗后训练蒸馏,无 CFG) |
| 编辑能力 |
Inpainting 局部重绘(单段/多段)、Causal Continuation 续写 |
| 微调 |
LoRA 训练(Small/Medium 开源权重) |
| 人声歌曲 |
❌ 不支持歌词演唱(这是与 Suno/Udio 的核心差异) |
| 音效生成 |
✅ Small SFX 专门模型,移动端 CPU 实时生成 |
| 分轨导出 |
✅ 付费 hosted 套餐支持(鼓/贝斯/旋律/FX) |
| DAW 插件 |
✅ Logic、Ableton、Pro Tools 插件 |
| 免费额度 |
10 次生成/月,30 秒裁切,个人非商用,带水印 |
| 商用授权 |
Pro 及以上套餐提供商用权利;开源权重 Community License 下年收入 < $1M 可商用 |
| 企业授权 |
年收入 > $1M 需企业许可,含法律赔偿(indemnification) |
| 合规 |
训练数据 100% 授权(AudioSparx + Freesound),企业输出法律赔偿 |
核心能力
1. AI 文本→音乐/音效(核心生成引擎)
- 机制:文本提示 → T5Gemma 文本编码 → 扩散模型在 SAME 潜空间去噪 → 变量时长解码为 44.1kHz 波形
- AI 作用:
- 深层文本分析:解析 nuanced 描述(流派、情绪、BPM、乐器、歌曲结构)
- 情感 AI 处理:将人类情感转化为音乐表达
- 潜扩散生成:flow-matching 公式预测连续速度场,8 步采样完成
- SAME 解码:语义-声学自编码器上采样,同时保真声学细节与语义结构
- 一次性产出:44.1kHz 立体声完整音乐或音效
- 价值:“Shape the sound you’re after”——从文本到专业音乐/音效,无需乐理
2. AI SAME 语义-声学自编码器(架构核心)
- 机制:4096× 压缩,256 维潜表示,10.76 Hz
- AI 作用:
- 双阶段压缩:256 样本块 patch → 16× Transformer 重采样
- 语义-声学联合训练:不仅重建波形,还捕获乐句、和声进行、节奏模式等语义结构
- 这是 6+ 分钟长曲目不漂移的关键
- 价值:架构级创新——区别于传统音频自编码器只优化声学重建保真度
3. AI 变量时长生成(per-second 粒度)
- 机制:根据请求时长动态分配潜帧数 L = ⌈(d + d_sp) × f_s / r⌉
- AI 作用:避免短音效浪费长曲目的计算预算,1 秒音效与 6 分 20 秒曲目使用匹配的潜帧数
- 价值:短音效与长曲目在同一管线高效生成——自动化音频流水线的基础
4. AI Inpainting 局部重绘(3.0 新增,核心编辑能力)
- 机制:传入掩码指定保留段,AI 仅重生成未掩码区域;支持单段/多段编辑
- AI 作用:
- 在每个 Transformer block 注入掩码与掩码潜变量(加法局部操作)
- 上下文感知的局部重生成,保持全曲连贯
- Medium 模型单段编辑 FAD 0.046(极高保真)
- 价值:“Swap out sections instead of regenerating the whole track” ——鼓点不对重新生成鼓点,副歌不匹配重绘副歌,无需整体重生成
5. AI Causal Continuation 续写
- 机制:从前向音频最终状态因果续写,扩展曲目超出原长
- AI 作用:保持已建立的谐波与节奏上下文
- 价值:从 30 秒 loop 扩展到 6 分 20 秒完整个案
6. AI Audio-to-Audio 风格转换
- 机制:上传音频 + 文本提示 → AI 做风格迁移/变体生成
- AI 作用:参考音频编码为风格嵌入,引导生成方向
- 价值:”Add audio into the generation process alongside text to experiment with style transfers”
7. AI 人声转换(Beta)
- 机制:上传人声录音 → AI 将其转换为音乐/音效
- AI 作用:注意:这不是歌词/演唱生成,而是将人声录音作为素材转化为器乐/纹理
- 价值:实验音乐/声音艺术的素材转化
8. AI LoRA 微调(Small/Medium 开源权重)
- 机制:用自有音频库训练 LoRA 适配器
- AI 作用:模型权重微调, specializing 特定风格/流派/声音调色板
- 价值:游戏工作室可用自有音频资产微调,生成匹配既有声音设计语言的音频
9. AI 分轨分离与 MIDI 导出(付费 hosted 套餐)
- 机制:生成结果分解为鼓/贝斯/旋律/FX 分轨
- AI 作用:AI 分离的 stems
- 价值:直接导入 Ableton/Logic Pro,对接专业 DAW 工作流
10. 端侧/离线生成(Small 开源权重独有)
- 机制:Small 模型可在移动端/消费笔记本 CPU 离线运行
- AI 作用:3.0 Small 是唯一能在端侧完成完整音乐合成的模型
- 价值:离线、隐私、零成本——”on-device and offline audio generation isn’t limited to short samples”
11. 企业级合规与法律赔偿
- 机制:Enterprise License 提供法律赔偿(indemnification)
- AI 作用:训练数据 100% 授权,企业商用输出获 Stability AI 法律背书
- 价值:Suno/Udio 在当前版权诉讼环境下无法提供的企业级保障
收费模式
Stable Audio 采用 “Hosted 订阅 + Developer API + 开源自托管”三轨并行 :
A. Hosted Web App 订阅(stableaudio.com)
| 套餐 |
价格 |
核心权益 |
| Free |
$0/月 |
10 次生成/月,30 秒裁切,个人非商用,带水印,部分区域不可用 |
| Pro |
$11.99/月 |
500 次生成/月,最长 3 分钟/首,30 分钟/月音频上传,商用权利 |
| Studio |
$29.99/月 |
1,500 次生成/月,60 分钟/月上传,分轨分离+MIDI 导出,商用权利 |
| Max |
$89.99/月 |
5,000 次生成/月,90 分钟/月上传,优先级处理,商用权利 |
| Enterprise |
定制 |
自托管、微调、SLA、法律赔偿 |
⚠️ Hosted 套餐关键规则:
- 未使用生成额度不滚存
- 免费版仅个人非商用,商用必须 Pro 或以上
- 当前 hosted app 运行的是 Stable Audio 2.5(3.0 模型主要通过 API/开源权重提供) ——这是 hosted 订阅的隐藏局限
- 无年付折扣
B. Developer API(platform.stability.ai)
- 计费:按 credit 计费,1 credit = $0.01
- Stable Audio 3.0 Large 仅通过 API 提供
- 无订阅费,按量付费
C. 开源自托管(Hugging Face)
- Small SFX / Small / Medium 开源权重,Community License 下:
- 年收入 < $1M:可自由商用,输出归用户所有
- 年收入 > $1M:需联系 Stability AI 获取 Enterprise License
- 成本转为算力与部署,而非订阅费
- 8GB VRAM GPU 或 Apple Silicon Mac 可运行 Medium;Small 可纯 CPU
优势亮点
- 唯一完全授权训练数据的消费级 AI 音乐平台:AudioSparx + Freesound 100% 授权,规避版权诉讼风险
- 开源权重(Small/Medium):Hugging Face 可下载,年收入 < $1M 可商用,可自托管/微调/离线
- 最长 6 分 20 秒变量时长生成:per-second 粒度,1 秒音效到 6:20 完整个案
- SAME 语义-声学自编码器:4096× 压缩,语义+声学联合建模,长曲目不漂移
- Inpainting 局部重绘:单段/多段编辑,Medium FAD 0.046 极高保真
- 端侧生成(Small 独有):移动端/笔记本 CPU 离线合成完整乐曲
- 极速推理:Small 0.45s/120s(H200),8 步 ping-pong 采样无 CFG
- AI LoRA 微调:用自有音频库训练风格适配器
- 音效生成专长:Small SFX 模型,游戏/影视音效设计的利器
- 分轨导出 + DAW 插件:Logic/Ableton/Pro Tools 直接对接
- 企业法律赔偿:Enterprise License 含 indemnification,Suno/Udio 无法提供
- API 按量计费:$0.01/credit,无订阅费
- Stability AI 品牌背书:Stable Diffusion 同源公司,AI 开源生态领导者
- UMG/WMG 合作伙伴:未来工具开发合作(虽未进入 3.0 训练集,但奠定合规基调)
局限性
| 方面 |
说明 |
| ❌ 不支持人声歌曲 |
Stable Audio 3.0 生成器仅针对器乐/音效,”人声转换 Beta”是将人声录音转化为器乐素材,不是歌词演唱——这是与 Suno/Udio 的根本差距 |
| Hosted app 仍运行 2.5 |
当前 stableaudio.com 订阅用户使用的是 2.5 模型,3.0 需通过 API 或开源权重 |
| 开源权重需技术部署 |
Small/Medium 自托管需要 GPU/Apple Silicon 与技术配置,非技术人员门槛高 |
| 年收入 > $1M 需企业许可 |
开源权重的 Community License 对高收入组织不适用 |
| 免费版限制严 |
10 次生成/月,30 秒裁切,非商用,部分区域不可用 |
| 未使用额度不滚存 |
Hosted 套餐按月重置 |
| 无年付折扣 |
仅有月付 |
| 提示词学习曲线 |
字面提示产生”mushy”输出,需学习结构化提示词(BPM、调性、乐器、结构) |
| Large 模型不开源 |
最高质量模型仅 API/企业自托管 |
| 复杂复调编排仍不及 Suno/Udio |
人声歌曲领域完全空白,纯器乐复杂编排也略逊 |