TTS(Text-to-Speech / 文本转语音)
1. 定义
TTS 是让机器把文字转换成自然人类语音的技术。它位于语音合成(Speech Synthesis)的核心,是智能助手、有声书、导航播报、无障碍读屏等应用的”发声”环节。
一句话类比:TTS 像一位”看不见的配音演员”——你递给它一段脚本(文本),它输出一段听不出是机器念的语音。
关联:TTS 是语音领域的生成任务,和 ASR(语音识别,语音→文本)方向相反;其声学建模同样依赖神经网络训练(梯度下降,见
gradient-descent.md)。
2. TTS 能做什么 / 解决什么问题
| 场景 | 作用 |
|---|---|
| 智能助手 / 车载 | 把回答念给用户听 |
| 有声内容 | 文章、书自动转成有声书 |
| 无障碍 | 为视障用户朗读屏幕文字 |
| 多语言 | 同一文本合成不同语言/音色 |
| 虚拟人 / 配音 | 给定参考音色,克隆说话人声音 |
3. 核心流程:三段式 pipeline
现代神经 TTS 一般拆成三步,前两步是”从文字到中间表示”,最后一步”把中间表示变波形”:
文本 "你好世界"
│
▼
[1. 文本前端 Frontend] → 归一化、分词、转音素、标韵律
│ 语言学特征 (phoneme / 重音 / 停顿)
▼
[2. 声学模型 Acoustic Model] → 预测声学特征 (Mel 谱图)
│ Mel-spectrogram (中间表示)
▼
[3. 声码器 Vocoder] → 把谱图还原成波形
│
▼
音频波形 wav (可听语音)
- 文本前端:把”数字、缩写、多音字”规整成标准读音(如 “2024” → “二零二四”),并切出音素和韵律。
- 声学模型:TTS 的”大脑”,决定说什么、怎么读(音高、节奏、停顿)。
- 声码器 (Vocoder):把声学特征逐样本还原成时域波形,决定音色是否清亮自然。
4. 技术演进:从拼接到大模型
| 阶段 | 方法 | 特点 |
|---|---|---|
| 拼接合成 (Concatenative) | 预先录好音库,拼录音片段 | 自然但生硬、覆盖有限、库巨大 |
| 统计参数 (HMM-based) | 用统计模型生成参数再合成 | 流畅但发”闷”、机器感强 |
| 神经声学模型 | Tacotron / FastSpeech 等 | 自然度飞跃,端到端训练 |
| 神经声码器 | WaveNet / HiFiGAN / WaveGlow | 还原高保真波形 |
| 端到端 / 大模型 | VITS、SpeechT5、Vall-E | 直接文本→波形,支持零样本克隆 |
5. 现代关键架构
- Tacotron / Tacotron 2:自回归 (autoregressive) 声学模型,逐帧生成 Mel 谱,自然但慢、易断句。
- FastSpeech / FastSpeech 2:非自回归 (non-autoregressive),一次并行产出整句,速度快、稳定、可控制语速——用 Teacher-Forcing 对齐,是工业界常用选择。
- 声码器:WaveNet 质量高但慢;HiFiGAN / MelGAN 用 GAN 思路做到实时高保真,成为主流。
- VITS:端到端变分推理 + 对抗训练,直接优化波形,自然度(MOS)接近真人。
- Vall-E / 零样本克隆:用少量参考音频”prompt”即可复刻音色,走向”语音版 GPT”。
| 维度 | 自回归 (Tacotron) | 非自回归 (FastSpeech) |
|---|---|---|
| 生成方式 | 逐帧顺序 | 整句并行 |
| 推理速度 | 慢 | 快(可实时) |
| 稳定性 | 可能重复/漏字 | 稳定 |
| 自然度 | 高 | 略低(靠后续改进追平) |
6. 关键指标
- 自然度 (Naturalness):通常用 MOS (Mean Opinion Score, 1~5 分) 由人打分衡量。
- 推理速度 / 实时率 (RTF):能否实时合成,端侧部署关键。
- 音色相似度:克隆任务里和参考说话人的接近程度。
- 鲁棒性:是否出现重复字、漏读、断句错。
7. 典型工作流(搭一个中文 TTS)
1. 准备文本 + 对应音频语料(或选用开源中文数据集)
2. 文本前端:中文分词 → 转拼音/音素 → 标韵律
3. 训练声学模型(FastSpeech2):文本特征 → Mel 谱
4. 训练/选用声码器(HiFiGAN):Mel 谱 → wav
5. 推理:输入文本 → 前端 → 声学模型 → 声码器 → 输出语音
6. 若做音色克隆:额外用参考音频做 speaker embedding8. 常见误区
- ❌ “TTS 就是拼接录音” → 现代主流是神经网络生成,拼接法已基本淘汰,自然度和覆盖都更强。
- ❌ “声学模型好就够自然” → 音色清亮度很大程度取决于声码器,差的 vocoder 会让高质量声学特征听起来发闷。
- ❌ “中文 TTS 直接按字念” → 必须做多音字 + 韵律处理,否则”银行""重行”等会读错、断句怪。
- ❌ “自回归模型更自然就无脑用” → 自回归易重复/漏字且慢,工业实时场景多用非自回归(FastSpeech)。
- ❌ “零样本克隆随便给 3 秒就能完美复刻” → 参考音频质量、噪声、时长都影响效果,且涉及声音伪造的伦理/合规风险。
9. 延伸阅读 / 关联概念
- ASR(语音识别) — TTS 的反方向任务(语音→文本),常成对出现
- 梯度下降 / 交叉熵 — 训练声学模型与 vocoder 的优化基础;见
gradient-descent.md、cross-entropy-loss.md - 自回归 vs 非自回归生成 — 理解 Tacotron 与 FastSpeech 取舍的核心
- GAN — HiFiGAN 等声码器用对抗训练提升保真度
- MOS 评测 — 语音自然度的主观评分标准
- 经典文献:Tacotron 2 (2017)、FastSpeech (2019)、HiFiGAN (2020)、VITS (2021)