
标贝悦读
标贝科技(Data Baker)旗下的 AI 语音合成与配音平台
火山语音是 字节跳动旗下火山引擎的 AI 语音合成服务(产品名”豆包语音-火山引擎”),AI 采用 “新一代大模型语音合成 + 在途学习(ICL)声音复刻 + 325 种音色矩阵 + 40+ 语种/多方言 + 流式/双向流式低延迟 + 情感/语调/语气词建模” 架构。火山引擎 TTS 被评价为:”国内开发者综合首选……国内项目主力 TTS……国内直连稳定,中文自然度 9/10″。
火山语音由 字节跳动(火山引擎) 研发,是 AI 语音合成赛道中”企业级 API + 大模型语音合成 + 声音复刻”路线的代表。火山引擎官网披露:通过火山方舟开启一站式大模型服务,豆包大模型持续更新聚焦 Coding & Agent 场景 。
AI 技术路线(火山引擎官方文档 ):
| 维度 | 大模型语音合成 | 传统语音合成 |
|---|---|---|
| 音色数量 | 325 种 | 84 种 |
| 算法效果 | 自然度、音质、韵律、气口、情感、语气词表达接近真人 | 合成效果流畅自然、发音清晰 |
| 支持语种 | 中文、英文、日文、西班牙;台普、北京、广州普、四川、河南、山东普、长沙 | 中、英、日、葡萄牙、西班牙、泰、越南、印尼;东北、西安、上海、广西普、台普、粤语、天津、川渝、郑州、湖南普 |
| 延迟 | 单向流式首包 ~600ms;双向流式支持 48K | 流式首包 ~300ms;不支持 48K |
核心差异化——企业级 API + 大模型合成 + 325 音色 + 40+ 语种 + 10-30 秒复刻 + 低延迟流式:
典型工作流:
核心规格:
| 规格 | 火山语音(火山引擎 TTS / 豆包语音)数值 |
|---|---|
| 平台 | REST API + WebSocket 流式 + 离线 SDK + 火山方舟平台;SDK 支持 Python/Java/Go/Node.js |
| AI 架构 | 新一代大模型语音合成 + ICL 声音复刻(1.0/2.0)+ 传统语音合成 |
| 大模型音色数量 | 325 种(自然语言度、音质、韵律、情感接近真人) |
| 传统音色数量 | 84 种 |
| 音色矩阵 | 聊天陪伴、有声书、音视频配音(视频趣味剪辑、专业创作、广告营销、新闻播报、电商带货)、数字人播报、语音客服 |
| 语种覆盖 | 40+ 语种:中、英、日、韩、德、法、俄、西班牙、阿拉伯等 |
| 方言口音 | 台普、北京、广州普、四川、河南、山东普、长沙(大模型);东北、西安、上海、广西普、台普、粤语、天津、川渝、郑州、湖南普(传统) |
| 声音复刻 | ✅ 10-30 秒参考音频(ICL 技术);1.0 秒级极速复刻;2.0 支持情感/语速灵活调控 |
| 复刻支持语种 | 中文、英语、日语、西班牙语、印尼语、葡萄牙语 |
| 跨语种迁移 | ✅ 一种声音说中英,只需单语种数据,无需针对不同语种分别录音 |
| 副语言建模 | ✅ 有声书场景实现笑声、哭腔等副语言现象建模 |
| 情感/语调预测 | ✅ 大模型根据上下文智能预测文本的情绪、语调 |
| 流式延迟 | 单向流式首包 ~600ms;传统流式首包 ~300ms;双向流式支持字级别时间戳 |
| 采样率 | 大模型:单向 24K/16K/8K,双向 48K/24K/16K/8K;传统:24K/16K/8K |
| 输出格式 | pcm / ogg_opus / mp3(单向);pcm / wav / mp3 / opus(双向) |
| SSML | ✅ 支持 SSML 标记语言(大模型单向/非流式接口暂不支持 SSML,双向流式与传统合成支持) |
| 调音参数 | 语速调整、音调调整、音高调整、字级别时间戳、Markdown、公式播报、Latex 能力 |
| 异步长文本 | ✅ 单次最大 10 万字符(开发者社区实测) |
| 部署方式 | 公共云、离线 SDK |
| 免费额度 | 系统音色 TTS 5 万字符;复刻音色 TTS 5 万字符;小模型合成 1500 次;声纹识别 600 次;大模型流式语音识别 180 分钟等 |
| 商用授权 | 按量付费/资源包,遵循火山引擎服务协议 |
| 声音复刻合规 | 火山引擎已施行数据收集、使用及存储等安全举措,确保用户本人在完全知晓并完成授权的状况下达成声音克隆 |
| 内部应用验证 | 豆包、剪映、抖音、番茄小说 |
| 母公司 | 字节跳动(火山引擎) |
火山语音采用 按字符计费 + 资源包预付费的双轨体系。官方定价来自火山引擎”音视频费用”2026 年 8 月 12 日 与”豆包语音计费说明”2026 年 8 月 20 日 实时数据:
| 计费项 | 免费额度 | 单价(现金结算) |
|---|---|---|
| 系统音色文字转语音字数 | 50,000 字符 | 0.0005 元/字符 |
| 复刻音色文字转语音字数 | 50,000 字符 | 0.0008 元/字符 |
| 豆包语音合成 2.0 – 系统音色 | 无 | 0.0003 元/字符 |
| 小模型合成次数 | 1,500 次 | 阶梯价 0.0040-0.0055 元/次 |
| 声音复刻-音色数量 | 1 个 | 138 元/个 |
| 音色模型存储数 | 1 个 | 1 元/个/月 |
| 声纹识别 | 600 次 | 0.005 元/次 |
💡 成本换算:系统音色 0.0005 元/字符 ≈ 0.5 元/千字符;复刻音色 0.0008 元/字符 ≈ 0.8 元/千字符;豆包语音合成 2.0 系统音色 0.0003 元/字符 ≈ 0.3 元/千字符——第三方实测给出”定价 1.3 元/千字” 是包含资源包/服务费的整体估算,按量计费本身更低。
| 商品服务 | 资源包规格 | 资源包价格 | 折算单价 |
|---|---|---|---|
| 豆包语音合成模型 2.0 | 10 万字 | 28 元 | 2.8 元/万字符 |
| 同上 | 2,000 万字 | 5,400 元 | 2.7 元/万字符 |
| 同上 | 20,000 万字 | 48,000 元 | 2.4 元/万字符 |
| 同上 | 200,000 万字 | 420,000 元 | 2.1 元/万字符 |
| 豆包声音复刻模型 2.0 | 10 万字 | 28 元 | 2.8 元/万字符 |
| 同上 | 2,000 万字 | 5,400 元 | 2.7 元/万字符 |
| 同上 | 20,000 万字 | 48,000 元 | 2.4 元/万字符 |
| 同上 | 200,000 万字 | 420,000 元 | 2.1 元/万字符 |
| 大模型语音合成 | 10 万字符 | 45 元 | 4.5 元/万字符 |
| 同上 | 100,000 万字符 | 200,000 元 | 2 元/万字符 |
| 同上 | 300,000 万字符 | 480,000 元 | 1.6 元/万字符 |
| 大模型声音复刻 | 10 万字符 | 75 元 | 7.5 元/万字符 |
| 同上 | 100,000 万字符 | 450,000 元 | 4.5 元/万字符 |
| 音色槽位(预付费) | 0-50 个 | 138 元/音色 | – |
| 同上 | 51-100 个 | 88 元/音色 | – |
| 同上 | 101-200 个 | 58 元/音色 | – |
| 同上 | 201-5000 个 | 38 元/音色 | – |
| 同上 | 5001-10000 个 | 28 元/音色 | – |
| 大模型精品复刻音色 | 标准版 | 30,000 元/音色 | – |
| 同上 | 专业版 | 80,000 元/音色 | – |
⚠️ 计费关键规则(极易踩坑):
- 系统音色按量 0.0005 元/字符,复刻音色 0.0008 元/字符 ——复刻音色比系统音色贵 60%
- 豆包语音合成 2.0 系统音色按量仅 0.0003 元/字符(最低价),但无免费额度
- 资源包 1 年有效期:所有资源包有效期 1 年,逾期作废
- 声音复刻资源 138 元/个起:每个资源支持最多 10 次训练;大模型精品复刻音色标准版 3 万元/音色、专业版 8 万元/音色——品牌级定制音色成本高昂
- 第三方”1.3 元/千字”:开发者社区实测的综合成本估算(含服务费/资源包),实际按量计费系统音色仅 0.5 元/千字
- 新用户试用额度:有试用额度,但无固定免费层(不同于 Azure TTS 50 万字符/月的固定免费层)
- 声音克隆合规:火山引擎已施行数据收集、使用及存储等安全举措,确保用户本人在完全知晓并完成授权的状况下达成声音克隆——商用务必取得当事人书面授权
| 方面 | 说明 |
|---|---|
| ⚠️ 消费端无”即开即用”配音工作台 | 火山语音主要提供 REST API / WebSocket / SDK / 离线 SDK,非技术人员使用门槛偏高;魔音工坊的创作工作台(视频云剪辑、自动打轴、字幕同步)更优——需要”即开即用”的创作者应选魔音工坊 |
| ⚠️ 情感细腻度不及海螺 Speech 2.8 | 海螺 Speech 2.8 支持原生声音标签 (laughs)/(breath)/(sighs),是 2.8 独占特性;火山语音虽支持副语言建模(笑声/哭腔),但在”原生副语言事件表达”上不及海螺——追求极致 TTS 表现力的用户应选海螺 |
| ❌ 无高质量 ASR 能力(单独) | 火山引擎虽有流式语音识别(0.075 元/分钟)与录音文件识别(0.039 元/分钟),但非其语音合成的主打;讯飞 TTS 在 ASR 上准确率 98% 是国内标杆——需要”听+说”一体化语音链的用户应选讯飞 |
| ⚠️ 企业级合规与私有化部署不及讯飞 | 讯飞 TTS 提供 SaaS/硬件/私有化部署全套;火山语音主要提供公共云与离线 SDK,政务金融合规场景需选讯飞 |
| ⚠️ 声音克隆商用合规需自行确保授权 | 火山引擎虽已施行数据收集、使用及存储等安全举措,但用户仍需确保当事人书面授权——”克隆真实人物声音未经其同意在大多数司法管辖区会产生法律风险” |
| ⚠️ 免费额度不如 Azure 慷慨 | Azure TTS 提供 50 万字符/月的固定免费层;火山语音仅有新用户试用额度,无固定免费层 ——成本敏感的个人开发者可能倾向 Azure |
| ⚠️ 首包延迟 300-400ms 不及 Azure | 第三方实测火山语音首包延迟 300-400ms ;Azure TTS 国内数据中心首包 ~120ms——对延迟有极致要求的实时交互场景,Azure 更优 |
| ⚠️ 第三方价格信息存在分歧 | 开发者社区实测”定价 1.3 元/千字” 是综合估算;官方按量系统音色仅 0.0005 元/字符(0.5 元/千字)——以 volcengine.com 计费说明实时定价为准 |
| ⚠️ 大模型精品复刻音色成本高昂 | 大模型精品复刻音色标准版 3 万元/音色、专业版 8 万元/音色 ——品牌级定制音色成本高昂,中小企业需评估 ROI |
| ❌ 无流式低延迟 <250ms | 海螺 Speech 2.6 端到端延迟 <250ms;火山语音首包 300-400ms——实时语音 agent 对延迟极度敏感的场景,海螺更优 |
| ⚠️ 方言覆盖不及讯飞 | 讯飞 TTS 拥有 10+ 方言业内第一覆盖;火山语音大模型方言口音覆盖台普/北京/广州普/四川/河南/山东普/长沙等 7 种 ——方言内容生产仍应选讯飞 |