海螺语音是 MiniMax稀宇科技(MiniMax)旗下的 AI 语音合成平台。在 2026 年国内 AI 语音音频工具盘点中,海螺语音被明确指出:”TTS 自然度高、情绪丰富,是数字人配套语音首选”。AI 采用 “Speech 2.8 旗舰模型(HD/Turbo 双档)+ 原生声音标签 + 10 秒音色克隆 + 40 语言 7 情绪 + 跨语言口音控制 + 流式/非流式/长文本异步生成” 架构,是 AI 语音合成赛道中少有的国产原生平台。
产品概述
海螺语音由 MiniMax稀宇科技(中国 AI 公司,海螺 AI 母公司)研发,是 AI 语音合成赛道中”高自然度 TTS + 声音克隆 + 数字人配套”路线的代表。2026 年 1 月 23 日 MiniMax 发布 Speech 2.8 旗舰模型,首次实现原生语气词支持 ,10 秒音色克隆 ,录音棚级音质 ,跨语言口音控制改善 。
AI 技术路线(MiniMax 官方与 API 文档 ):
- Speech 2.8 旗舰模型(2026 年 1 月 23 日发布):
- speech-2.8-hd:”Ultra-realistic quality featuring sound tags” ——极致拟真质量,当前旗舰
- speech-2.8-turbo:”Seamless speed meets natural flow” ——无缝速度与自然流畅,当前快速档
- 原生声音标签(2.8 独占):(laughs)、(chuckle)、(coughs)、(clear-throat)、(sighs)、(sneezes) 等——直接写入文本,模型在原位执行,无需后期拼接
- 10 秒音色克隆:约 10 秒音频即可高精度克隆,捕捉音色质感、气息、语速习惯
- 更干净的管道:重新设计的音频堆栈降低背景噪声与合成失真,修复跨语言”口音渗透”(从普通话-日语对开始)
- Speech 2.6(旧代,2025 年 10 月 30 日发布):
- speech-2.6-hd / 2.6-turbo:实时语音、低延迟旧代模型,仍是家族的实时基础
- 发布时宣称端到端延迟 <250 毫秒
- 原生处理 URL、邮箱、电话号码、日期、货币金额而无需预处理
- Fluent LoRA 克隆:保留说话人音色,即使在 imperfect 不流畅的源音频上也能生成流畅输出,覆盖 40+ 语言
- Speech-02(遗留模型):24 语言支持,遗留档
- 语音合成规格(API 官方参考 ):
- 语言:~40 种(通过 language_boost:中文、粤语、英语、阿拉伯语、印地语、日语、韩语、越南语、泰米尔语等),支持自动检测
- 采样率:8 kHz – 44.1 kHz
- 格式:MP3、PCM、FLAC、WAV、G.711、Opus
- 情感参数:happy、sad、angry、fearful、disgusted、surprised、calm、fluent、whisper
- 声音塑形:Pitch(音调)、intensity(强度)、timbre(音色)均在 -100 到 100 刻度上可调
- 效果预设:spacious_echo(空间回声)、lofi_telephone(lofi 电话)、robotic(机器人)
- 声音混合:通过 timbre_weights 混合多个声音
- Voice Design(声音设计):文本描述→可复用合成声音,$3/声音
- Rapid Voice Cloning(快速声音克隆):$1.5/声音,一次性收费,之后该声音像系统声音一样被调用
核心差异化——TTS 自然度 + 情绪丰富度 + 声音克隆 + 数字人配套:
- Speech 2.8 原生声音标签:(laughs)/(breath)/(sighs)/(coughs) 直接写入文本——这是海螺相对于讯飞 TTS(情感语音仅 10 种模式)、魔音工坊、火山语音的独占突破
- 10 秒高精度音色克隆:约 10 秒音频即可克隆,捕捉质感、气息、语速——”复刻出来的声音不再只是’听着像’,而是真正还原了你说话的灵魂”
- 300+ 现成音色:覆盖 40 语言
- 四维声音塑形:情感 + 音调 + 强度 + 音色,均为 -100 到 100 刻度可调;效果预设;声音混合——”更像 channel strip 而非典型 TTS 参数列表”
- 流式/非流式/长文本异步:HTTP/WebSocket 同步 TTS + 异步长文本 TTS(有声书/长文档)
- 跨语言口音控制:改善普通话-日语对的跨语言”口音渗透”
- 数字人配套首选:2026 年 8 月 Cannes 电影节上,Storyverse 使用 MiniMax Speech 2.8 为意大利犯罪剧《Il Cinese》重现地区口音差异与角色特定声乐特征 ——AI 语音从独立 TTS 演示迈入影视制作市场
- 低延迟实时档:Speech 2.6 的 <250ms 端到端延迟,适合语音 agent、实时对话
典型工作流:
- 选择输入方式:A – 纯文本(可嵌入声音标签如 (laughs)(breath));B – 文本 + 声音标签;C – 上传参考音频进行音色克隆;D – 文本描述生成 Voice Design
- 选择模型:speech-2.8-hd(质量优先)/ speech-2.8-turbo(成本与速度优先)/ speech-2.6-turbo(实时低延迟)
- 选择声音:300+ 现成音色 / 克隆声音 / Voice Design 生成声音
- AI 生成:
- Speech 2.8:原生解析声音标签,10 秒克隆捕捉音色灵魂,录音棚级管道降噪
- 情感/音调/强度/音色调节:-100 到 100 刻度精调
- 效果预设:spacious_echo / lofi_telephone / robotic
- 声音混合:timbre_weights 混合多个声音
- 输出:MP3/WAV/FLAC(非流式);MP3(流式);长文本异步生成有声书
- 声音克隆(如需要):上传 10 秒-5 分钟干净音频(MP3/M4A/WAV,≤20MB),$1.5/声音一次性收费
- 商用授权:订阅套餐包含商用权利(Commercial Use rights for new songs/audio made)
核心规格:
| 规格 |
海螺语音(MiniMax Audio)数值 |
| 平台 |
网页端(minimax.io/audio)+ API(platform.minimax.io)+ 全球可用英文界面 |
| AI 架构 |
Speech 2.8(当前旗舰,HD/Turbo)+ Speech 2.6(旧代实时)+ Speech-02(遗留);Voice Design + Rapid Voice Cloning |
| 当前模型 |
speech-2.8-hd / speech-2.8-turbo(2026年1月23日发布) |
| 旧代/遗留模型 |
speech-2.6-hd/turbo(旧代)、speech-02-hd/turbo(遗留) |
| 原生声音标签 |
✅ 2.8 独占:(laughs)、(chuckle)、(coughs)、(clear-throat)、(sighs)、(sneezes) 等 |
| 音色克隆 |
✅ 约 10 秒音频即可高精度克隆 ;Rapid Cloning $1.5/声音 |
| Voice Design |
✅ 文本描述→可复用合成声音,$3/声音 |
| 语言覆盖 |
~40 种(中文、粤语、英语、阿拉伯语、印地语、日语、韩语、越南语、泰米尔语等)+ 自动检测 |
| 情感参数 |
9 种:happy/sad/angry/fearful/disgusted/surprised/calm/fluent/whisper |
| 声音塑形 |
音调/强度/音色,均 -100 到 100 刻度可调 |
| 效果预设 |
spacious_echo / lofi_telephone / robotic |
| 声音混合 |
✅ timbre_weights 混合多个声音 |
| 采样率 |
8 kHz – 44.1 kHz |
| 输出格式 |
MP3、PCM、FLAC、WAV、G.711、Opus |
| 流式/低延迟 |
✅ Speech 2.6 端到端延迟 <250ms |
| 长文本异步 |
✅ 异步 TTS 支持有声书/长文档 |
| API 方式 |
HTTP / WebSocket 同步 + 异步长文本 |
| 免费额度 |
Free:登录后每日限时免费 credits,基础功能+有限声音克隆+API |
| 商用权利 |
付费订阅包含新生成内容的商用权利(Commercial Use rights) |
| 网页订阅定价 |
Starter $5/月(年付 $4.5/月,10万 credits);Standard $30/月(年付?,100万 credits);Top-up $30/百万 credits |
| API 定价 |
speech-2.8-turbo $60/百万字符;speech-2.8-hd $100/百万字符;Rapid Cloning $1.5/声音;Voice Design $3/声音 |
| 声音克隆合规 |
⚠️ MiniMax 未提供公开的克隆同意机制,用户需自行承担同意与授权责任 |
| 跨语言口音控制 |
✅ 改善普通话-日语对的”口音渗透” |
| 影视级应用 |
✅ 2026 年 8 月 Cannes 电影节 Storyverse 使用 Speech 2.8 为意大利犯罪剧《Il Cinese》重现地区口音与角色声音特征 |
| 母公司 |
MiniMax稀宇科技(中国公司,上海),海螺 AI 母公司 |
核心能力
1. AI Speech 2.8 端到端 TTS(核心引擎)
- 机制:用户输入文本(可嵌入声音标签)
- AI 作用:Speech 2.8 模型将文本转换为自然语音
- 2.8 的三大突破 :
- 原生声音标签:(laughs)/(breath)/(sighs)/(coughs) 直接写入文本,模型在原位执行,无需后期拼接
- 10 秒音色克隆:约 10 秒音频即可高精度克隆,捕捉质感、气息、语速
- 更干净的管道:重新设计的音频堆栈降低背景噪声与合成失真
- 价值:“让合成语音听起来更像真人在说话”——AI 不只做机械的文本→语音映射,而是还原真人说话时的呼吸、停顿、犹豫、笑声、叹息
2. AI 原生声音标签(2.8 独占)
- 机制:用户在文本中直接写入 (laughs)、(breath)、(sighs)、(coughs)、(clear-throat)、(sneezes) 等标签
- AI 作用:Speech 2.8 原生解析并执行声音标签——模型在原位”表演”笑声、呼吸、叹息,而非从素材库拼接
- 价值:这是海螺相对于讯飞 TTS、魔音工坊、火山语音的独占突破——AI 语音首次具备”副语言事件”(paralinguistic events)的原生表达能力
3. AI 10 秒音色克隆
- 机制:用户上传 10 秒-5 分钟干净音频(MP3/M4A/WAV,≤20MB)
- AI 作用:Speech 2.8 精准捕捉声音质感、气息、特有语速习惯
- 价值:“复刻出来的声音不再只是’听着像’,而是真正还原了你说话的灵魂” ——MiniMax 官方演示中,Speech 2.8 完美捕捉了原声中低频的胸腔共鸣与细腻的鼻音特征
4. AI Voice Design(文本→可复用声音)
- 机制:用户输入文本描述(如”温柔的女声,带一点沙哑,语速偏慢”)
- AI 作用:AI 生成符合描述的可复用合成声音,$3/声音
- 价值:“声音即设计”——无需上传参考音频,用文字描述即可创造专属声音
5. AI 跨语言口音控制
- 机制:Speech 2.8 改善跨语言”口音渗透”
- AI 作用:在普通话-日语对的跨语言合成中减少口音渗透,改善发音偏移
- 价值:跨语言内容生产的准确性提升——国产内容出海、外语教学、跨文化配音的关键能力
6. AI 四维声音塑形
- 机制:情感(9 种)+ 音调(-100 到 100)+ 强度(-100 到 100)+ 音色(-100 到 100)
- AI 作用:AI 根据四维参数实时调节输出语音
- 效果预设:spacious_echo(空间回声)、lofi_telephone(lofi 电话)、robotic(机器人)
- 价值:“更像 channel strip 而非典型 TTS 参数列表”——AI 语音的参数控制粒度达到专业音频处理级别
7. AI 声音混合
- 机制:通过 timbre_weights 混合多个声音
- AI 作用:AI 将多个声音的音色特征按权重混合,生成新的混合音色
- 价值:创造独特音色——两个现成声音的混合可产生市面上不存在的独特音色
8. AI 流式低延迟 TTS(Speech 2.6)
- 机制:Speech 2.6-turbo 端到端延迟 <250ms
- AI 作用:AI 实时生成语音流,适合语音 agent、实时对话、直播配音
- 价值:“实时语音、低延迟”——语音 agent、AI 助手、实时交互场景的基础
9. AI 长文本异步生成
- 机制:异步 TTS API
- AI 作用:AI 处理长文本(有声书/长文档),异步返回完整音频
- 价值:有声书/长文档的批量生成——单次生成可达 10,000 字符(turbo)或 5,000 字符(hd)
10. AI 影视级声音特征控制
- 机制:2026 年 8 月 Cannes 电影节 Storyverse 案例
- AI 作用:Speech 2.8 为意大利犯罪剧《Il Cinese》重现地区口音差异与角色特定声乐特征 ——两层控制:一层处理地理(地区口音),另一层处理角色身份(个体声音特征)
- 价值:AI 语音从独立 TTS 演示迈入影视制作市场——AI 语音正在被影视产业作为”casting texture, localization”的工具使用
11. AI 格式化智能处理(Speech 2.6 传承)
- 机制:原生处理 URL、邮箱、电话号码、日期、货币金额
- AI 作用:无需预处理的格式化智能朗读
- 价值:“URL、邮箱、电话号码、日期、货币金额”自然朗读——这是 AI 对结构化文本的语义理解能力
收费模式
海螺语音采用 Freemium + 双轨定价体系——网页产品订阅与 API 按字符计费是两套独立的定价体系,用户极易混淆。价格来自 2026 年 8 月 MiniMax 官方文档与订阅页实时核验 :
网页产品订阅(minimax.io/audio/subscribe)
⚠️ 网页订阅关键规则 :
- 月付 credits 月末清零:”All monthly credits expire at the end of each calendar month” ——需在当月用完
- Top-up credits 有效期 2 个月:2026年2月12日后购买的 credits 有效期为购买日起 2 个月;此前购买的旧 credits 仍保持 2 年有效
- 系统自动优先使用临近过期的 credits
- 无退款:已支付的月费不予退款,取消订阅在下个计费周期生效
- 声音槽位分级:Free 3 个 / Starter 10 个 / Standard 30 个 / Pro 250 个
API 按字符计费(platform.minimax.io)
| 计费项 |
价格 |
| speech-2.8-turbo |
$60/百万字符 |
| speech-2.8-hd |
$100/百万字符 |
| Rapid Voice Cloning |
$1.5/声音(一次性) |
| Voice Design |
$3/声音 |
⚠️ API 计费关键规则 :
- 字符计费,非 credits:API 按字符数计费,密集技术脚本比同等口语长度的脚本更贵(因为字符更多)
- Turbo 比 HD 便宜 40%:Turbo $60 vs HD $100;Turbo 单次调用接受 2 倍文本(10,000 字符 vs 5,000 字符)
- 实际速度无显著差异:第三方实测显示 turbo 与 hd 在相同 990 字符文本上生成速度持平,选 turbo 主要为了更便宜的单价与更高的单次文本上限
- Token Plan 不涵盖语音:MiniMax 的 Token Plan 明确排除 Voice Design 与 Rapid Voice Cloning——Token Plan 订阅不支付这两项费用
- 声音克隆合规需自行审查:MiniMax 未提供公开的克隆同意机制,用户需自行承担同意与授权责任
优势亮点
- Speech 2.8 原生声音标签(2.8 独占):(laughs)/(breath)/(sighs)/(coughs) 直接写入文本,AI 原位执行——这是海螺相对于讯飞 TTS、魔音工坊、火山语音的独占突破
- 10 秒高精度音色克隆:约 10 秒音频即可克隆,捕捉质感、气息、语速——”复刻出来的声音不再只是’听着像’,而是真正还原了你说话的灵魂”
- Voice Design:文本描述→可复用合成声音,$3/声音——”声音即设计”
- 300+ 现成音色:覆盖 40 语言
- 四维声音塑形:情感(9 种)+ 音调 + 强度 + 音色,均 -100 到 100 刻度可调——”更像 channel strip 而非典型 TTS 参数列表”
- 效果预设:spacious_echo / lofi_telephone / robotic
- 声音混合:timbre_weights 混合多个声音,创造独特音色
- 40 语言覆盖:中文、粤语、英语、阿拉伯语、印地语、日语、韩语、越南语、泰米尔语等 + 自动检测
- 9 种情感参数:happy/sad/angry/fearful/disgusted/surprised/calm/fluent/whisper
- 流式低延迟:Speech 2.6 端到端延迟 <250ms,适合语音 agent、实时对话
- 长文本异步生成:有声书/长文档的批量生成,单次最高 10,000 字符(turbo)
- 跨语言口音控制:改善普通话-日语对的”口音渗透”
- 影视级应用:2026 年 8 月 Cannes 电影节 Storyverse 使用 Speech 2.8 为意大利犯罪剧《Il Cinese》重现地区口音与角色声音特征
- 数字人配套首选:2026 年国内 AI 语音音频工具盘点明确指出”海螺语音 TTS 自然度高、情绪丰富,是数字人配套语音首选”
- 多格式输出:MP3、PCM、FLAC、WAV、G.711、Opus;采样率 8 kHz – 44.1 kHz
- 双轨定价灵活:网页订阅 $5/月起;API 按字符 $60-100/百万字符
- 国产自研:MiniMax稀宇科技(中国公司,上海),国产 TTS 第一梯队
- 全球可用:国际 API 与英文界面全球可用
局限性
| 方面 |
说明 |
| ❌ 无高质量 ASR 能力 |
海螺语音专注 TTS,语音识别能力一般;讯飞 TTS 在 ASR 上准确率 98% 是国内标杆——需要”听+说”一体化语音链的用户应选讯飞 |
| ⚠️ 声音克隆合规风险 |
MiniMax 未提供公开的克隆同意机制,用户需自行承担同意与授权责任 ;”克隆真实人物声音未经其同意在大多数司法管辖区会产生法律风险” ——商用务必取得书面授权 |
| ⚠️ 中文方言覆盖不及讯飞 |
讯飞 TTS 拥有 10+ 方言业内第一覆盖;海螺语音主要覆盖标准普通话与主要语种,方言内容生产仍应选讯飞 |
| ❌ 无企业级私有化部署 |
讯飞 TTS 提供 SaaS/硬件/私有化部署全套;海螺语音主要提供 SaaS 与 API,政务金融合规场景需选讯飞 |
| ⚠️ 月付 credits 月末清零 |
“All monthly credits expire at the end of each calendar month” ——需在当月用完,否则作废 |
| ⚠️ Top-up credits 有效期仅 2 个月 |
2026年2月12日后购买的 credits 有效期为购买日起 2 个月 ——大额囤积 credits 需谨慎 |
| ⚠️ Token Plan 不涵盖语音 |
MiniMax 的 Token Plan 明确排除 Voice Design 与 Rapid Voice Cloning ——使用声音克隆与设计需额外付费 |
| ⚠️ 英文 TTS 质量仍与 ElevenLabs 有差距 |
跨境/英文高端内容场景,ElevenLabs 仍是全球标杆 |
| ⚠️ 第三方价格聚合站可能滞后 |
网页订阅与 API 定价独立且高频调整,以 minimax.io/audio/subscribe 与 platform.minimax.io 实时价格为准 |
| ⚠️ 服务条款运营主体可能涉及海外实体 |
MiniMax Audio 全球可用,国际 API 与英文界面运营主体可能涉及新加坡等海外实体;严格意义上的”纯国产”需微小校准 |
| ❌ 无免费高质量声音克隆 |
Free 用户仅有”有限声音克隆函数”;高质量克隆从 Starter $5/月起 |
| ⚠️ HD 与 Turbo 实际速度差异不大 |
第三方实测显示 turbo 与 hd 在相同文本上生成速度持平,选 HD 主要为了质量而非速度 |