Stable Audio翻译站点

1周前更新 8 0 0

Stability AI 旗下的 AI 音乐与音效生成平台

语言:
英文
收录时间:
2026-09-03
Stable AudioStable Audio

Stable AudioStability AI(Stable Diffusion 同名母公司)旗下的 AI 音乐与音效生成平台,2026 年 5 月 20 日正式发布 Stable Audio 3.0 模型家族——这是当前 AI 音乐生成赛道唯一”完全授权训练数据 + 开源权重 + 可自托管”的组合 。主打”文本生成乐器音乐、音效、声音景观,最长 6 分 20 秒,支持分轨输出、局部重绘(Inpainting)、LoRA 微调、开源自托管”。

 

产品概述

Stability AI 于 2026 年 5 月 20 日发布 Stable Audio 3.0 模型家族​ ,包含 4 个变体 :

模型 参数量 最大时长 部署方式 适用场景
3.0 Small SFX 459M diffusion + 108M SAME-S 2 分钟 开源权重(Hugging Face) 移动端/笔记本 CPU 实时音效生成
3.0 Small 459M diffusion + 108M SAME-S 2 分钟 开源权重 唯一能在端侧/离线生成完整乐曲的模型
3.0 Medium 1.4B diffusion + 852M SAME-L 6 分 20 秒 开源权重 开发者/生产环境默认选择
3.0 Large 2.7B diffusion + 852M SAME-L 6 分 20 秒 仅 API / 企业自托管 音乐平台/创意应用的高并发低延迟生成

架构突破——SAME 语义-声学自编码器

  • 压缩比 4096×(256 样本块 → 16× Transformer 重采样 → 256 维潜表示,约 10.76 Hz)
  • 损失函数融合多分辨率 STFT 重建 + 相对论 GAN + 跨模态对比对齐 + 语义回归(色度、耳间电平差)——既保真声学细节,又捕获语义结构(乐句、和声、节奏模式)
  • 这是 Medium/Large 能在 6+ 分钟内”不漂移成浆糊”的根本原因

推理速度(H200 GPU)​ :

  • Small:0.45 秒生成 120 秒音乐
  • Medium:0.78 秒生成 120 秒音乐
  • Large:0.81 秒生成 120 秒音乐
  • 8 步 ping-pong 采样,无需 CFG(分类器自由引导)——蒸馏热身阶段已将引导内化,推理速度约 2 倍提升

训练数据完全授权​ :

  • AudioSparx 贡献 806,284 首完全授权曲目
  • Freesound 贡献 472,618 首 CC 授权音频(CC-0、CC-BY、CC-Sampling+)
  • 总计 1,278,902 条音频
  • UMG/WMG 合作是”未来工具开发伙伴”,其厂牌目录未进入 3.0 训练集——Stability AI 刻意将此作为企业销售卖点

典型工作流

  1. 文本提示:输入详细描述,如”120 BPM acid-house break with rolling sub bass and analog synth pads, 90 seconds, build-up at 30s”
  2. AI 生成:SAME 编码 → 扩散模型潜空间去噪 → 变量时长解码为 44.1kHz 立体声波形
  3. 局部编辑:用 Inpainting 选择时间段重生成(单段/多段),或用 Causal Continuation 向前续写
  4. 风格迁移:Audio-to-Audio 上传参考音频 + 文本提示,做风格转换/变体生成
  5. 人声转换(Beta):上传人声录音 → AI 将其转换为音乐/音效(注意:这不是歌词演唱生成​ )
  6. 分轨导出:付费套餐支持鼓/贝斯/旋律/FX 分轨,直接导入 Ableton/Logic Pro
  7. 微调(LoRA):Small/Medium 支持用自有音频库训练 LoRA 适配器

核心规格

规格 Stable Audio 3.0 数值
平台 Web 网页端(stableaudio.com)、API(platform.stability.ai)、开源权重自托管
当前模型 Stable Audio 3.0 Small / Small SFX / Medium(开源)/ Large(API)
AI 架构 文本条件潜扩散 + SAME 语义-声学自编码器 + Transformer 主干 + 差分注意力(Medium/Large)
输出采样率 44.1kHz 立体声
最大时长 Small 2 分钟 / Medium & Large 6 分 20 秒
时长粒度 per-second 变量时长,1 秒到 6:20 任意长度
生成速度 Small 0.45s/120s、Medium 0.78s/120s、Large 0.81s/120s(H200)
推理步数 8 步 ping-pong 采样(对抗后训练蒸馏,无 CFG)
编辑能力 Inpainting 局部重绘(单段/多段)、Causal Continuation 续写
微调 LoRA 训练(Small/Medium 开源权重)
人声歌曲 ❌ 不支持歌词演唱(这是与 Suno/Udio 的核心差异)
音效生成 ✅ Small SFX 专门模型,移动端 CPU 实时生成
分轨导出 ✅ 付费 hosted 套餐支持(鼓/贝斯/旋律/FX)
DAW 插件 ✅ Logic、Ableton、Pro Tools 插件
免费额度 10 次生成/月,30 秒裁切,个人非商用,带水印
商用授权 Pro 及以上套餐提供商用权利;开源权重 Community License 下年收入 < $1M 可商用
企业授权 年收入 > $1M 需企业许可,含法律赔偿(indemnification)
合规 训练数据 100% 授权(AudioSparx + Freesound),企业输出法律赔偿

 

核心能力

1. AI 文本→音乐/音效(核心生成引擎)

  • 机制:文本提示 → T5Gemma 文本编码 → 扩散模型在 SAME 潜空间去噪 → 变量时长解码为 44.1kHz 波形
  • AI 作用
    • 深层文本分析:解析 nuanced 描述(流派、情绪、BPM、乐器、歌曲结构)
    • 情感 AI 处理:将人类情感转化为音乐表达
    • 潜扩散生成:flow-matching 公式预测连续速度场,8 步采样完成
    • SAME 解码:语义-声学自编码器上采样,同时保真声学细节与语义结构
  • 一次性产出:44.1kHz 立体声完整音乐或音效
  • 价值“Shape the sound you’re after”——从文本到专业音乐/音效,无需乐理

2. AI SAME 语义-声学自编码器(架构核心)

  • 机制:4096× 压缩,256 维潜表示,10.76 Hz
  • AI 作用
    • 双阶段压缩:256 样本块 patch → 16× Transformer 重采样
    • 语义-声学联合训练:不仅重建波形,还捕获乐句、和声进行、节奏模式等语义结构
    • 这是 6+ 分钟长曲目不漂移的关键
  • 价值架构级创新——区别于传统音频自编码器只优化声学重建保真度

3. AI 变量时长生成(per-second 粒度)

  • 机制:根据请求时长动态分配潜帧数 L = ⌈(d + d_sp) × f_s / r⌉
  • AI 作用:避免短音效浪费长曲目的计算预算,1 秒音效与 6 分 20 秒曲目使用匹配的潜帧数
  • 价值短音效与长曲目在同一管线高效生成——自动化音频流水线的基础

4. AI Inpainting 局部重绘(3.0 新增,核心编辑能力)

  • 机制:传入掩码指定保留段,AI 仅重生成未掩码区域;支持单段/多段编辑
  • AI 作用
    • 在每个 Transformer block 注入掩码与掩码潜变量(加法局部操作)
    • 上下文感知的局部重生成,保持全曲连贯
    • Medium 模型单段编辑 FAD 0.046(极高保真)
  • 价值“Swap out sections instead of regenerating the whole track”​ ——鼓点不对重新生成鼓点,副歌不匹配重绘副歌,无需整体重生成

5. AI Causal Continuation 续写

  • 机制:从前向音频最终状态因果续写,扩展曲目超出原长
  • AI 作用:保持已建立的谐波与节奏上下文
  • 价值:从 30 秒 loop 扩展到 6 分 20 秒完整个案

6. AI Audio-to-Audio 风格转换

  • 机制:上传音频 + 文本提示 → AI 做风格迁移/变体生成
  • AI 作用:参考音频编码为风格嵌入,引导生成方向
  • 价值:”Add audio into the generation process alongside text to experiment with style transfers”

7. AI 人声转换(Beta)

  • 机制:上传人声录音 → AI 将其转换为音乐/音效
  • AI 作用注意:这不是歌词/演唱生成,而是将人声录音作为素材转化为器乐/纹理
  • 价值:实验音乐/声音艺术的素材转化

8. AI LoRA 微调(Small/Medium 开源权重)

  • 机制:用自有音频库训练 LoRA 适配器
  • AI 作用:模型权重微调, specializing 特定风格/流派/声音调色板
  • 价值:游戏工作室可用自有音频资产微调,生成匹配既有声音设计语言的音频

9. AI 分轨分离与 MIDI 导出(付费 hosted 套餐)

  • 机制:生成结果分解为鼓/贝斯/旋律/FX 分轨
  • AI 作用:AI 分离的 stems
  • 价值:直接导入 Ableton/Logic Pro,对接专业 DAW 工作流

10. 端侧/离线生成(Small 开源权重独有)

  • 机制:Small 模型可在移动端/消费笔记本 CPU 离线运行
  • AI 作用3.0 Small 是唯一能在端侧完成完整音乐合成的模型
  • 价值:离线、隐私、零成本——”on-device and offline audio generation isn’t limited to short samples”

11. 企业级合规与法律赔偿

  • 机制:Enterprise License 提供法律赔偿(indemnification)
  • AI 作用:训练数据 100% 授权,企业商用输出获 Stability AI 法律背书
  • 价值Suno/Udio 在当前版权诉讼环境下无法提供的企业级保障

 

收费模式

Stable Audio 采用 “Hosted 订阅 + Developer API + 开源自托管”三轨并行​ :

A. Hosted Web App 订阅(stableaudio.com)

套餐 价格 核心权益
Free $0/月 10 次生成/月,30 秒裁切,个人非商用,带水印,部分区域不可用
Pro $11.99/月 500 次生成/月,最长 3 分钟/首,30 分钟/月音频上传,商用权利
Studio $29.99/月 1,500 次生成/月,60 分钟/月上传,分轨分离+MIDI 导出,商用权利
Max $89.99/月 5,000 次生成/月,90 分钟/月上传,优先级处理,商用权利
Enterprise 定制 自托管、微调、SLA、法律赔偿

⚠️ Hosted 套餐关键规则

  1. 未使用生成额度不滚存
  2. 免费版仅个人非商用,商用必须 Pro 或以上
  3. 当前 hosted app 运行的是 Stable Audio 2.5(3.0 模型主要通过 API/开源权重提供) ——这是 hosted 订阅的隐藏局限
  4. 无年付折扣

B. Developer API(platform.stability.ai)

  • 计费:按 credit 计费,1 credit = $0.01
  • Stable Audio 3.0 Large 仅通过 API 提供
  • 无订阅费,按量付费

C. 开源自托管(Hugging Face)

  • Small SFX / Small / Medium 开源权重,Community License 下:
    • 年收入 < $1M:可自由商用,输出归用户所有
    • 年收入 > $1M:需联系 Stability AI 获取 Enterprise License
  • 成本转为算力与部署,而非订阅费
  • 8GB VRAM GPU 或 Apple Silicon Mac 可运行 Medium;Small 可纯 CPU

 

优势亮点

  1. 唯一完全授权训练数据的消费级 AI 音乐平台:AudioSparx + Freesound 100% 授权,规避版权诉讼风险
  2. 开源权重(Small/Medium):Hugging Face 可下载,年收入 < $1M 可商用,可自托管/微调/离线
  3. 最长 6 分 20 秒变量时长生成:per-second 粒度,1 秒音效到 6:20 完整个案
  4. SAME 语义-声学自编码器:4096× 压缩,语义+声学联合建模,长曲目不漂移
  5. Inpainting 局部重绘:单段/多段编辑,Medium FAD 0.046 极高保真
  6. 端侧生成(Small 独有):移动端/笔记本 CPU 离线合成完整乐曲
  7. 极速推理:Small 0.45s/120s(H200),8 步 ping-pong 采样无 CFG
  8. AI LoRA 微调:用自有音频库训练风格适配器
  9. 音效生成专长:Small SFX 模型,游戏/影视音效设计的利器
  10. 分轨导出 + DAW 插件:Logic/Ableton/Pro Tools 直接对接
  11. 企业法律赔偿:Enterprise License 含 indemnification,Suno/Udio 无法提供
  12. API 按量计费:$0.01/credit,无订阅费
  13. Stability AI 品牌背书:Stable Diffusion 同源公司,AI 开源生态领导者
  14. UMG/WMG 合作伙伴:未来工具开发合作(虽未进入 3.0 训练集,但奠定合规基调)

 

局限性

方面 说明
❌ 不支持人声歌曲 Stable Audio 3.0 生成器仅针对器乐/音效,”人声转换 Beta”是将人声录音转化为器乐素材,不是歌词演唱——这是与 Suno/Udio 的根本差距
Hosted app 仍运行 2.5 当前 stableaudio.com 订阅用户使用的是 2.5 模型,3.0 需通过 API 或开源权重
开源权重需技术部署 Small/Medium 自托管需要 GPU/Apple Silicon 与技术配置,非技术人员门槛高
年收入 > $1M 需企业许可 开源权重的 Community License 对高收入组织不适用
免费版限制严 10 次生成/月,30 秒裁切,非商用,部分区域不可用
未使用额度不滚存 Hosted 套餐按月重置
无年付折扣 仅有月付
提示词学习曲线 字面提示产生”mushy”输出,需学习结构化提示词(BPM、调性、乐器、结构)
Large 模型不开源 最高质量模型仅 API/企业自托管
复杂复调编排仍不及 Suno/Udio 人声歌曲领域完全空白,纯器乐复杂编排也略逊

相关导航