海螺语音

1周前发布 10 0 0

MiniMax 旗下的 AI 语音合成平台

所在地:
中国
语言:
中文
收录时间:
2026-09-04
其他站点:
海螺语音海螺语音

海螺语音是 MiniMax稀宇科技(MiniMax)旗下的 AI 语音合成平台。在 2026 年国内 AI 语音音频工具盘点中,海螺语音被明确指出:”TTS 自然度高、情绪丰富,是数字人配套语音首选”。AI 采用 “Speech 2.8 旗舰模型(HD/Turbo 双档)+ 原生声音标签 + 10 秒音色克隆 + 40 语言 7 情绪 + 跨语言口音控制 + 流式/非流式/长文本异步生成”​ 架构,是 AI 语音合成赛道中少有的国产原生平台。

 

产品概述

海螺语音由 MiniMax稀宇科技(中国 AI 公司,海螺 AI 母公司)研发,是 AI 语音合成赛道中”高自然度 TTS + 声音克隆 + 数字人配套”路线的代表。2026 年 1 月 23 日 MiniMax 发布 Speech 2.8​ 旗舰模型,首次实现原生语气词支持 ,10 秒音色克隆 ,录音棚级音质 ,跨语言口音控制改善 。

AI 技术路线(MiniMax 官方与 API 文档 )

  • Speech 2.8 旗舰模型(2026 年 1 月 23 日发布)
    • speech-2.8-hd:”Ultra-realistic quality featuring sound tags” ——极致拟真质量,当前旗舰
    • speech-2.8-turbo:”Seamless speed meets natural flow” ——无缝速度与自然流畅,当前快速档
    • 原生声音标签(2.8 独占):(laughs)、(chuckle)、(coughs)、(clear-throat)、(sighs)、(sneezes) 等——直接写入文本,模型在原位执行,无需后期拼接
    • 10 秒音色克隆:约 10 秒音频即可高精度克隆,捕捉音色质感、气息、语速习惯
    • 更干净的管道:重新设计的音频堆栈降低背景噪声与合成失真,修复跨语言”口音渗透”(从普通话-日语对开始)
  • Speech 2.6(旧代,2025 年 10 月 30 日发布)
    • speech-2.6-hd / 2.6-turbo:实时语音、低延迟旧代模型,仍是家族的实时基础
    • 发布时宣称端到端延迟 <250 毫秒
    • 原生处理 URL、邮箱、电话号码、日期、货币金额而无需预处理
    • Fluent LoRA 克隆:保留说话人音色,即使在 imperfect 不流畅的源音频上也能生成流畅输出,覆盖 40+ 语言
  • Speech-02(遗留模型):24 语言支持,遗留档
  • 语音合成规格(API 官方参考 )
    • 语言:~40 种(通过 language_boost:中文、粤语、英语、阿拉伯语、印地语、日语、韩语、越南语、泰米尔语等),支持自动检测
    • 采样率:8 kHz – 44.1 kHz
    • 格式:MP3、PCM、FLAC、WAV、G.711、Opus
    • 情感参数:happy、sad、angry、fearful、disgusted、surprised、calm、fluent、whisper
    • 声音塑形:Pitch(音调)、intensity(强度)、timbre(音色)均在 -100 到 100 刻度上可调
    • 效果预设:spacious_echo(空间回声)、lofi_telephone(lofi 电话)、robotic(机器人)
    • 声音混合:通过 timbre_weights 混合多个声音
  • Voice Design(声音设计):文本描述→可复用合成声音,$3/声音
  • Rapid Voice Cloning(快速声音克隆):$1.5/声音,一次性收费,之后该声音像系统声音一样被调用

核心差异化——TTS 自然度 + 情绪丰富度 + 声音克隆 + 数字人配套

  • Speech 2.8 原生声音标签:(laughs)/(breath)/(sighs)/(coughs) 直接写入文本——这是海螺相对于讯飞 TTS(情感语音仅 10 种模式)、魔音工坊、火山语音的独占突破
  • 10 秒高精度音色克隆:约 10 秒音频即可克隆,捕捉质感、气息、语速——”复刻出来的声音不再只是’听着像’,而是真正还原了你说话的灵魂”
  • 300+ 现成音色:覆盖 40 语言
  • 四维声音塑形:情感 + 音调 + 强度 + 音色,均为 -100 到 100 刻度可调;效果预设;声音混合——”更像 channel strip 而非典型 TTS 参数列表”
  • 流式/非流式/长文本异步:HTTP/WebSocket 同步 TTS + 异步长文本 TTS(有声书/长文档)
  • 跨语言口音控制:改善普通话-日语对的跨语言”口音渗透”
  • 数字人配套首选:2026 年 8 月 Cannes 电影节上,Storyverse 使用 MiniMax Speech 2.8 为意大利犯罪剧《Il Cinese》重现地区口音差异与角色特定声乐特征 ——AI 语音从独立 TTS 演示迈入影视制作市场
  • 低延迟实时档:Speech 2.6 的 <250ms 端到端延迟,适合语音 agent、实时对话

典型工作流

  1. 选择输入方式:A – 纯文本(可嵌入声音标签如 (laughs)(breath));B – 文本 + 声音标签;C – 上传参考音频进行音色克隆;D – 文本描述生成 Voice Design
  2. 选择模型:speech-2.8-hd(质量优先)/ speech-2.8-turbo(成本与速度优先)/ speech-2.6-turbo(实时低延迟)
  3. 选择声音:300+ 现成音色 / 克隆声音 / Voice Design 生成声音
  4. AI 生成
    • Speech 2.8:原生解析声音标签,10 秒克隆捕捉音色灵魂,录音棚级管道降噪
    • 情感/音调/强度/音色调节:-100 到 100 刻度精调
    • 效果预设:spacious_echo / lofi_telephone / robotic
    • 声音混合:timbre_weights 混合多个声音
  5. 输出:MP3/WAV/FLAC(非流式);MP3(流式);长文本异步生成有声书
  6. 声音克隆(如需要):上传 10 秒-5 分钟干净音频(MP3/M4A/WAV,≤20MB),$1.5/声音一次性收费
  7. 商用授权:订阅套餐包含商用权利(Commercial Use rights for new songs/audio made)

核心规格

规格 海螺语音(MiniMax Audio)数值
平台 网页端(minimax.io/audio)+ API(platform.minimax.io)+ 全球可用英文界面
AI 架构 Speech 2.8(当前旗舰,HD/Turbo)+ Speech 2.6(旧代实时)+ Speech-02(遗留);Voice Design + Rapid Voice Cloning
当前模型 speech-2.8-hd / speech-2.8-turbo(2026年1月23日发布)
旧代/遗留模型 speech-2.6-hd/turbo(旧代)、speech-02-hd/turbo(遗留)
原生声音标签 2.8 独占:(laughs)、(chuckle)、(coughs)、(clear-throat)、(sighs)、(sneezes) 等
音色克隆 ✅ 约 10 秒音频即可高精度克隆 ;Rapid Cloning $1.5/声音
Voice Design ✅ 文本描述→可复用合成声音,$3/声音
语言覆盖 ~40 种(中文、粤语、英语、阿拉伯语、印地语、日语、韩语、越南语、泰米尔语等)+ 自动检测
情感参数 9 种:happy/sad/angry/fearful/disgusted/surprised/calm/fluent/whisper
声音塑形 音调/强度/音色,均 -100 到 100 刻度可调
效果预设 spacious_echo / lofi_telephone / robotic
声音混合 ✅ timbre_weights 混合多个声音
采样率 8 kHz – 44.1 kHz
输出格式 MP3、PCM、FLAC、WAV、G.711、Opus
流式/低延迟 ✅ Speech 2.6 端到端延迟 <250ms
长文本异步 ✅ 异步 TTS 支持有声书/长文档
API 方式 HTTP / WebSocket 同步 + 异步长文本
免费额度 Free:登录后每日限时免费 credits,基础功能+有限声音克隆+API
商用权利 付费订阅包含新生成内容的商用权利(Commercial Use rights)
网页订阅定价 Starter $5/月(年付 $4.5/月,10万 credits);Standard $30/月(年付?,100万 credits);Top-up $30/百万 credits
API 定价 speech-2.8-turbo $60/百万字符;speech-2.8-hd $100/百万字符;Rapid Cloning $1.5/声音;Voice Design $3/声音
声音克隆合规 ⚠️ MiniMax 未提供公开的克隆同意机制,用户需自行承担同意与授权责任
跨语言口音控制 ✅ 改善普通话-日语对的”口音渗透”
影视级应用 ✅ 2026 年 8 月 Cannes 电影节 Storyverse 使用 Speech 2.8 为意大利犯罪剧《Il Cinese》重现地区口音与角色声音特征
母公司 MiniMax稀宇科技(中国公司,上海),海螺 AI 母公司

 

核心能力

1. AI Speech 2.8 端到端 TTS(核心引擎)

  • 机制:用户输入文本(可嵌入声音标签)
  • AI 作用:Speech 2.8 模型将文本转换为自然语音
  • 2.8 的三大突破
    • 原生声音标签:(laughs)/(breath)/(sighs)/(coughs) 直接写入文本,模型在原位执行,无需后期拼接
    • 10 秒音色克隆:约 10 秒音频即可高精度克隆,捕捉质感、气息、语速
    • 更干净的管道:重新设计的音频堆栈降低背景噪声与合成失真
  • 价值“让合成语音听起来更像真人在说话”——AI 不只做机械的文本→语音映射,而是还原真人说话时的呼吸、停顿、犹豫、笑声、叹息

2. AI 原生声音标签(2.8 独占)

  • 机制:用户在文本中直接写入 (laughs)、(breath)、(sighs)、(coughs)、(clear-throat)、(sneezes) 等标签
  • AI 作用:Speech 2.8 原生解析并执行声音标签——模型在原位”表演”笑声、呼吸、叹息,而非从素材库拼接
  • 价值这是海螺相对于讯飞 TTS、魔音工坊、火山语音的独占突破——AI 语音首次具备”副语言事件”(paralinguistic events)的原生表达能力

3. AI 10 秒音色克隆

  • 机制:用户上传 10 秒-5 分钟干净音频(MP3/M4A/WAV,≤20MB)
  • AI 作用:Speech 2.8 精准捕捉声音质感、气息、特有语速习惯
  • 价值“复刻出来的声音不再只是’听着像’,而是真正还原了你说话的灵魂”​ ——MiniMax 官方演示中,Speech 2.8 完美捕捉了原声中低频的胸腔共鸣与细腻的鼻音特征

4. AI Voice Design(文本→可复用声音)

  • 机制:用户输入文本描述(如”温柔的女声,带一点沙哑,语速偏慢”)
  • AI 作用:AI 生成符合描述的可复用合成声音,$3/声音
  • 价值“声音即设计”——无需上传参考音频,用文字描述即可创造专属声音

5. AI 跨语言口音控制

  • 机制:Speech 2.8 改善跨语言”口音渗透”
  • AI 作用:在普通话-日语对的跨语言合成中减少口音渗透,改善发音偏移
  • 价值跨语言内容生产的准确性提升——国产内容出海、外语教学、跨文化配音的关键能力

6. AI 四维声音塑形

  • 机制:情感(9 种)+ 音调(-100 到 100)+ 强度(-100 到 100)+ 音色(-100 到 100)
  • AI 作用:AI 根据四维参数实时调节输出语音
  • 效果预设:spacious_echo(空间回声)、lofi_telephone(lofi 电话)、robotic(机器人)
  • 价值“更像 channel strip 而非典型 TTS 参数列表”——AI 语音的参数控制粒度达到专业音频处理级别

7. AI 声音混合

  • 机制:通过 timbre_weights 混合多个声音
  • AI 作用:AI 将多个声音的音色特征按权重混合,生成新的混合音色
  • 价值创造独特音色——两个现成声音的混合可产生市面上不存在的独特音色

8. AI 流式低延迟 TTS(Speech 2.6)

  • 机制:Speech 2.6-turbo 端到端延迟 <250ms
  • AI 作用:AI 实时生成语音流,适合语音 agent、实时对话、直播配音
  • 价值“实时语音、低延迟”——语音 agent、AI 助手、实时交互场景的基础

9. AI 长文本异步生成

  • 机制:异步 TTS API
  • AI 作用:AI 处理长文本(有声书/长文档),异步返回完整音频
  • 价值有声书/长文档的批量生成——单次生成可达 10,000 字符(turbo)或 5,000 字符(hd)

10. AI 影视级声音特征控制

  • 机制:2026 年 8 月 Cannes 电影节 Storyverse 案例
  • AI 作用:Speech 2.8 为意大利犯罪剧《Il Cinese》重现地区口音差异角色特定声乐特征​ ——两层控制:一层处理地理(地区口音),另一层处理角色身份(个体声音特征)
  • 价值AI 语音从独立 TTS 演示迈入影视制作市场——AI 语音正在被影视产业作为”casting texture, localization”的工具使用

11. AI 格式化智能处理(Speech 2.6 传承)

  • 机制:原生处理 URL、邮箱、电话号码、日期、货币金额
  • AI 作用:无需预处理的格式化智能朗读
  • 价值“URL、邮箱、电话号码、日期、货币金额”自然朗读——这是 AI 对结构化文本的语义理解能力

 

收费模式

海螺语音采用 Freemium + 双轨定价体系——网页产品订阅API 按字符计费是两套独立的定价体系,用户极易混淆。价格来自 2026 年 8 月 MiniMax 官方文档与订阅页实时核验​ :

网页产品订阅(minimax.io/audio/subscribe)

套餐 月付 年付(月等效) Credits 核心权益
Free $0 永久 每月 10k credits 礼物 基础功能;有限声音克隆;API 基础访问
Starter $5/月 $4.5/月($54/年,省 10%) 100k credits/月 加速生成;10 个声音槽位;新生成内容商用权利
Standard $30/月 未披露年付价 100 万 credits/月 加速生成;40+ 语言;Turbo 模型;无限声音克隆;新生成内容商用权利
Top-up $30/百万 credits 一次性购买 加速生成;2026年2月12日后购买的 credits 有效期 2 个月

⚠️ 网页订阅关键规则​ :

  1. 月付 credits 月末清零:”All monthly credits expire at the end of each calendar month” ——需在当月用完
  2. Top-up credits 有效期 2 个月:2026年2月12日后购买的 credits 有效期为购买日起 2 个月;此前购买的旧 credits 仍保持 2 年有效
  3. 系统自动优先使用临近过期的 credits
  4. 无退款:已支付的月费不予退款,取消订阅在下个计费周期生效
  5. 声音槽位分级:Free 3 个 / Starter 10 个 / Standard 30 个 / Pro 250 个

API 按字符计费(platform.minimax.io)

计费项 价格
speech-2.8-turbo $60/百万字符
speech-2.8-hd $100/百万字符
Rapid Voice Cloning $1.5/声音(一次性)
Voice Design $3/声音

⚠️ API 计费关键规则​ :

  1. 字符计费,非 credits:API 按字符数计费,密集技术脚本比同等口语长度的脚本更贵(因为字符更多)
  2. Turbo 比 HD 便宜 40%:Turbo $60 vs HD $100;Turbo 单次调用接受 2 倍文本(10,000 字符 vs 5,000 字符)
  3. 实际速度无显著差异:第三方实测显示 turbo 与 hd 在相同 990 字符文本上生成速度持平,选 turbo 主要为了更便宜的单价与更高的单次文本上限
  4. Token Plan 不涵盖语音:MiniMax 的 Token Plan 明确排除 Voice Design 与 Rapid Voice Cloning——Token Plan 订阅不支付这两项费用
  5. 声音克隆合规需自行审查:MiniMax 未提供公开的克隆同意机制,用户需自行承担同意与授权责任

 

优势亮点

  1. Speech 2.8 原生声音标签(2.8 独占):(laughs)/(breath)/(sighs)/(coughs) 直接写入文本,AI 原位执行——这是海螺相对于讯飞 TTS、魔音工坊、火山语音的独占突破
  2. 10 秒高精度音色克隆:约 10 秒音频即可克隆,捕捉质感、气息、语速——”复刻出来的声音不再只是’听着像’,而是真正还原了你说话的灵魂”
  3. Voice Design:文本描述→可复用合成声音,$3/声音——”声音即设计”
  4. 300+ 现成音色:覆盖 40 语言
  5. 四维声音塑形:情感(9 种)+ 音调 + 强度 + 音色,均 -100 到 100 刻度可调——”更像 channel strip 而非典型 TTS 参数列表”
  6. 效果预设:spacious_echo / lofi_telephone / robotic
  7. 声音混合:timbre_weights 混合多个声音,创造独特音色
  8. 40 语言覆盖:中文、粤语、英语、阿拉伯语、印地语、日语、韩语、越南语、泰米尔语等 + 自动检测
  9. 9 种情感参数:happy/sad/angry/fearful/disgusted/surprised/calm/fluent/whisper
  10. 流式低延迟:Speech 2.6 端到端延迟 <250ms,适合语音 agent、实时对话
  11. 长文本异步生成:有声书/长文档的批量生成,单次最高 10,000 字符(turbo)
  12. 跨语言口音控制:改善普通话-日语对的”口音渗透”
  13. 影视级应用:2026 年 8 月 Cannes 电影节 Storyverse 使用 Speech 2.8 为意大利犯罪剧《Il Cinese》重现地区口音与角色声音特征
  14. 数字人配套首选:2026 年国内 AI 语音音频工具盘点明确指出”海螺语音 TTS 自然度高、情绪丰富,是数字人配套语音首选”
  15. 多格式输出:MP3、PCM、FLAC、WAV、G.711、Opus;采样率 8 kHz – 44.1 kHz
  16. 双轨定价灵活:网页订阅 $5/月起;API 按字符 $60-100/百万字符
  17. 国产自研:MiniMax稀宇科技(中国公司,上海),国产 TTS 第一梯队
  18. 全球可用:国际 API 与英文界面全球可用

 

局限性

方面 说明
❌ 无高质量 ASR 能力 海螺语音专注 TTS,语音识别能力一般;讯飞 TTS 在 ASR 上准确率 98% 是国内标杆——需要”听+说”一体化语音链的用户应选讯飞
⚠️ 声音克隆合规风险 MiniMax 未提供公开的克隆同意机制,用户需自行承担同意与授权责任 ;”克隆真实人物声音未经其同意在大多数司法管辖区会产生法律风险” ——商用务必取得书面授权
⚠️ 中文方言覆盖不及讯飞 讯飞 TTS 拥有 10+ 方言业内第一覆盖;海螺语音主要覆盖标准普通话与主要语种,方言内容生产仍应选讯飞
❌ 无企业级私有化部署 讯飞 TTS 提供 SaaS/硬件/私有化部署全套;海螺语音主要提供 SaaS 与 API,政务金融合规场景需选讯飞
⚠️ 月付 credits 月末清零 “All monthly credits expire at the end of each calendar month” ——需在当月用完,否则作废
⚠️ Top-up credits 有效期仅 2 个月 2026年2月12日后购买的 credits 有效期为购买日起 2 个月 ——大额囤积 credits 需谨慎
⚠️ Token Plan 不涵盖语音 MiniMax 的 Token Plan 明确排除 Voice Design 与 Rapid Voice Cloning ——使用声音克隆与设计需额外付费
⚠️ 英文 TTS 质量仍与 ElevenLabs 有差距 跨境/英文高端内容场景,ElevenLabs 仍是全球标杆
⚠️ 第三方价格聚合站可能滞后 网页订阅与 API 定价独立且高频调整,以 minimax.io/audio/subscribe 与 platform.minimax.io 实时价格为准
⚠️ 服务条款运营主体可能涉及海外实体 MiniMax Audio 全球可用,国际 API 与英文界面运营主体可能涉及新加坡等海外实体;严格意义上的”纯国产”需微小校准
❌ 无免费高质量声音克隆 Free 用户仅有”有限声音克隆函数”;高质量克隆从 Starter $5/月起
⚠️ HD 与 Turbo 实际速度差异不大 第三方实测显示 turbo 与 hd 在相同文本上生成速度持平,选 HD 主要为了质量而非速度

相关导航