Udio

1周前发布 8 0 0

Uncharted Labs 出品的 AI 音乐生成平台

语言:
英文
收录时间:
2026-09-03

Udio 是 AI 音乐生成平台(Uncharted Labs 出品,前 DeepMind 团队),AI 采用 “LLM 歌词与结构生成 + 扩散模型/Transformer 音频合成”两阶段管线——第一阶段由大语言模型解析提示词、生成带 [Verse] [Chorus] 结构的歌词;第二阶段由音乐扩散模型将噪声逐步精炼为波形,配合 Transformer 处理时序关系,一次性合成包含主唱(情感、气息、颤音可控)、乐器编曲、混音的完整体 。

Udio 的典型工作流是”先生成 32 秒片段 → Extend 向前/向后延展 → Remix/Inpaint 局部重绘”,通过 4-8 次迭代拼出 2-4 分钟完整个案​ 。

 

产品概述

Udio 由 Uncharted Labs​ 开发,团队核心为 前 Google DeepMind 工程师,2024 年 4 月正式发布 。2025 年 10 月 29 日与 UMG 签署授权协议;2025 年末与 华纳音乐集团(WMG)达成和解并签授权;2026 年初与 Merlin(独立音乐数字版权代理方)签署合作 。由此,Udio 正从”开放生成”向”完全授权的 AI 音乐平台“转型,2026 年推出新版授权平台,产品重心转向授权内容 remix 与粉丝互动模型​ 。

当前可用模型:官方帮助中心仍在 v1 / v1.5 / v1.5 Allegro 的过渡访问状态,未公开披露新的旗舰模型(这与 Suno 已发布 v5.5 形成对比)。

典型工作流

  1. 输入提示:描述流派、情绪、乐器、主题(如”upbeat indie pop song with jangly guitars and female vocals about a summer road trip”),可选提供自定义歌词或选择纯器乐
  2. AI 生成片段:两阶段管线输出两个 32 秒片段变体(也可选 130 秒长格式)
  3. 挑选与延展:选择偏好变体,通过 Extend​ 向前/向后延展,逐步添加 Intro/Verse/Chorus/Bridge/Outro
  4. 局部重绘:用 Inpaint​ 重生成特定时间段(如某句歌词唱得不好),其余部分保持不变;用 Remix​ 改变风格/节奏/情绪
  5. 声线与风格控制(Standard 及以上):Voice Control​ 调整声线特征、Style Blending​ 融合多种流派、Audio Upload​ 上传参考音频引导、Custom Voices​ 保存复用
  6. 导出:⚠️ 当前下载禁用(UMG 合作过渡期),用户可在平台内播放/分享/设置访问权限

核心规格

规格 Udio 数值
平台 Web 网页端(udio.com)、iOS App(同账号同步信用点);Android 官方未宣布
当前模型 过渡期访问 v1 / v1.5 / v1.5 Allegro;新授权平台模型细节未披露
AI 架构 两阶段:LLM(歌词与结构)+ 扩散模型/Transformer(音频波形合成)
初始片段长度 32 秒(默认)/ 130 秒(长格式模式)
完整歌曲时长 通过 4-8 次 Extend 迭代构建 2-4 分钟完整个案
流派覆盖 流行、摇滚、嘻哈、R&B、乡村、爵士、电子、古典、金属、民谣、氛围等数十种;复杂流派(爵士/古典/前卫金属)表现优于 Suno v4
语言支持 10+ 语言演唱
声线控制 Voice Control(Standard+)、Custom Voices(保存复用)、Library Voices
参考音频 Audio Upload(Standard+):上传音频引导生成
编辑能力 Extend(延展)、Remix(重混)、Inpaint(局部重绘)、Crop(裁剪)
免费额度 10 信用点/天 + 100 信用点/月(不滚存),每天最多 3 首 130 秒歌曲
并发生成 免费 2(4 首)、Standard 3(6 首)、Pro 5(10 首)
下载状态 ⚠️ 禁用中(2025/10/29 UMG 合作起,音频/视频/分轨下载均关闭)
商用权利 ⚠️ 官方定价页未单列商用权行;需遵循 UMG/WMG/Merlin 合作最新条款
合规 已实施”state-of-the-art 过滤器”防止复现版权作品或艺人声音

 

核心能力

1. AI 两阶段歌曲生成(核心引擎)

  • 第一阶段(LLM 歌词与结构):大语言模型解析用户提示词,生成符合流派、情绪、主题的歌词,并组织 [Verse] [Chorus] [Bridge] 等基本歌曲架构
  • 第二阶段(扩散模型 + Transformer 音频合成):音乐生成模型从噪声逐步精炼为音频波形;Transformer 处理时序关系(音符/节拍如何随时间流动);多模态训练使模型理解”音频 + 元数据(流派/情绪/艺人)”的关联
  • 输出:32 秒片段(两个变体),包含主唱、和声、乐器编曲、混音的完整体
  • AI 作用:端到端从文本到波形,非 MIDI 拼接、非采样
  • 价值“音乐界的 ChatGPT”——文本描述到完整音乐片段

2. AI 情感化人声合成(Udio 最强卖点)

  • 机制:扩散模型合成歌声,控制情感、气息、颤音、声线性别
  • AI 作用
    • 情感注入:根据歌词语义注入情绪(悲伤时声音嘶哑、愤怒时粗粝、喜悦时明亮)
    • 自然语言短语:自然的停顿、关键词强调、会话式语流
    • 音素级对齐:多语言演唱发音
  • 行业评价:Tom’s Guide 评价 Udio “具有捕捉合成人声中情感的非凡能力……是唯一捕捉到演唱激情、痛苦与灵魂的 AI 音乐生成器”——测试者提示”heartbreak ballad, male vocalist, raw and vulnerable”,Udio 生成的曲目中人声在”goodbye”一词上字面意义上破裂(cracking voice),这是 Suno、Stable Audio 都未曾实现的
  • 价值真人感演唱——这是 Udio 相对 Suno 最显著的差异化能力

3. AI Extend 歌曲延展

  • 机制:将 32 秒初始片段向前或向后延展,添加 Intro/Verse/Chorus/Bridge/Outro
  • AI 作用:自回归续写,保持主题/调性/声线一致性;每段可提供不同歌词、改变情绪或强度
  • 价值从片段到完整个案——大多数用户通过 4-8 次 Extend 步骤构建 2-4 分钟完整曲目

4. AI Inpainting 局部重绘(Udio 独占能力)

  • 机制:选择时间段,AI 仅重生成该片段,其余部分保持不变
  • AI 作用:上下文感知的局部重生成,保持与全曲的连贯性
  • 价值Suno 至今未提供的精细化编辑能力——某句歌词唱砸了只需 Inpaint 那一句,无需整体重生成

5. AI Remix 风格重混

  • 机制:在保持歌曲整体上下文的同时,改变风格、节奏或情绪重新生成某段
  • AI 作用:风格迁移
  • 价值:快速探索同一素材的多种可能

6. AI Voice Control(Standard+)

  • 机制:调整声线的风格与特征
  • AI 作用:声线特征解耦与控制
  • 价值:比纯文本提示更可控的人声输出

7. AI Style Blending(Standard+)

  • 机制:混合多种流派影响
  • AI 作用:多风格 embedding 融合
  • 价值:创造跨流派的新声音

8. AI 参考音频引导(Standard+)

  • 机制:上传音频文件,AI 围绕其构建歌曲(Audio Upload)
  • AI 作用:音频编码为风格嵌入,引导生成方向与质感
  • 价值:让”脑海里的旋律”变成完整歌曲

9. AI Custom Voices 与 Library Voices

  • 机制:从 Udio 声音库选择,或保存/复用自定义声音
  • AI 作用:声线身份一致性
  • 价值:专辑/系列内容声线统一

10. AI 合规过滤

  • 机制:Udio 官方声明已实现并持续优化”state-of-the-art 过滤器”,确保模型不复现训练集中的版权作品或艺人声音
  • AI 作用:推理时安全层拦截
  • 价值:降低版权风险(尽管 RIAA 诉讼仍在进行中)

 

收费模式

Udio 采用 Freemium + 信用点体系,年付约省 20% :

套餐 价格 核心权益
Free $0/月 10 信用点/天 + 100 信用点/月(不滚存),每天最多 3 首 130 秒歌曲,2 并发,基础生成,不可商用,⚠️ 无下载
Standard $10/月(年付 $8/月) 2,400 信用点/月,无日限,6 并发,Voice Control、Style Blending、Audio Upload、Lyric Editing、Custom Cover Art​ 解锁,⚠️ 下载仍禁用(UMG 过渡期)
Pro $30/月(年付 $24/月) 6,000 信用点/月,10 并发,所有功能,发布歌曲的访问权限控制,⚠️ 下载仍禁用
学生套餐 认证大学 50% 折扣(6 个月)
信用点加购 100 信用点 $3 / 1,000 信用点 $25 永久有效(订阅信用点不滚存,加购信用点不过期)

⚠️ 计费与版权关键规则(极易踩坑):

  1. 下载禁用:2025/10/29 UMG 合作起,音频/视频/分轨下载全部禁用 ——当前 Udio 用户无法导出作品,创作只能留在平台内
  2. 商用权利不明确:官方定价页未单列商用权行 ,传统评测中”付费套餐可商用”的说法已不适用于 2026 年当前状态——商用必须以 UMG/WMG/Merlin 合作最新条款为准
  3. 信用点不滚存:日额度每日重置、月额度每月重置;仅加购信用点永久有效
  4. 免费版不可商用:免费版需署名,Standard/Pro 才去署名(但商用仍需看厂牌合作条款)
  5. 无 API:Udio 不提供 API,无法嵌入外部工作流(对比 Suno 有 Enterprise API)
  6. 新授权平台定价未披露:2026 年完全授权的 Udio 新平台价格方案官方尚未公布

 

优势亮点

  1. 人声情感真实度行业最强:Tom’s Guide 评价为”唯一捕捉到演唱激情、痛苦与灵魂的 AI 音乐工具”,能实现声音嘶哑破裂等细节
  2. AI Inpainting 局部重绘(独有):Suno 至今未提供的精细化编辑能力
  3. 复杂流派表现优异:爵士、古典、前卫金属等密集编曲场景优于 Suno v4
  4. 两阶段生成管线:LLM 处理歌词与结构 + 扩散/Transformer 合成音频,输出质量接近专业母带
  5. Extend/Remix 迭代工作流:4-8 次延展构建完整个案,给予创作者高度控制
  6. Voice Control + Style Blending(Standard+):声线与风格精细调控
  7. 参考音频上传(Standard+):哼唱/片段引导生成
  8. 多语言演唱:10+ 语言,跨语种发声自然
  9. 信用点加购永久有效:轻量用户经济
  10. 厂牌授权合规:UMG/WMG/Merlin 三方合作,2026 年转向完全授权平台
  11. DeepMind 团队背景:技术底蕴深厚
  12. 学生折扣:认证大学 50% off 6 个月

 

局限性

方面 说明
⚠️ 下载禁用(最关键) 2025/10/29 UMG 合作起,音频/视频/分轨下载全部禁用 ,创作只能留在平台内
⚠️ 商用权利不明 官方定价页未单列商用权行 ,需遵循厂牌合作最新条款;传统”付费可商用”说法已不适用 2026 现状
产品方向 pivot 向”授权内容 remix + 粉丝互动”转型,旧有的开放生成自由度将收窄
无 API 无法嵌入外部工作流/应用,对比 Suno Enterprise 有 API
团队规模小 Uncharted Labs 相较 Suno(D 轮 4 亿美元)体量更小,longevity 风险
RIAA 诉讼仍在进行 尽管已与 UMG/WMG/Merlin 和解,RIAA 诉讼未完全终结
生成速度较慢 30 秒到数分钟不等,慢于 Suno 的一句话成片
免费版限制严 10 信用点/天 + 100/月,不滚存,每天最多 3 首 130 秒歌曲,不可商用
重音/饶舌人声偶现瑕疵 饶舌清晰度是已知弱点
新模型未披露 仍停留在 v1.5 Allegro 过渡访问,对比 Suno v5.5 模型迭代落后
Android 无官方应用 仅 iOS App + Web

相关导航