CMDF-TTS:文本转化为语音的方法具有有限的目标扬声器语料库
Ye Tao1, Jiawang Liu1, Chaofeng Lu1
1School of Information Science and Technology, Qingdao University of Science and Technology, Qingdao 266061, PR China.
概括
本研究介绍了一种快速的文本转语音 (TTS) 方法,使用基于统计的压缩辅助体 (SCAC) 算法. 它大大降低了培训成本和高质量的语音合成的时间,使用最小的目标音箱数据.
科学领域:
- 语音合成 语音合成
- 机器学习 机器学习
- 数字信号处理是数字信号处理.
背景情况:
- 端到端的文本到语音 (TTS) 模型需要大量的辅助体,增加培训成本.
- 现有的方法在使用有限的目标扬声器数据时,难以进行高质量的合成.
研究的目的:
- 开发一种快速,高质量的语音合成方法,使用最小的目标音箱录音.
- 为了减少与TTS中大型辅助机构相关的大量培训成本.
主要方法:
- 提出了一个基于统计的压缩辅助集群 (SCAC) 算法来优化辅助数据.
- 开发了一个非自行回归模型,CMDF-TTS,结合了多层次的代和Denoising扩散概率模型 (DDPMs).
- 利用条件变量自动编码器生成对抗网络 (CVAE-GAN) 进一步提高质量.
主要成果:
- 该SCAC算法显著提高模型训练速度,而不会影响言语的自然性.
- 通过SCAC增强的CMDF-TTS显示了训练效率和合成语音质量之间的平衡.
- 实验结果显示,在普通话和英语数据集上,与最先进的模型相比,性能优越.
结论:
- 拟议的SCAC算法有效地减少了对TTS的辅助体的要求.
- CMDF-TTS为高效和高质量的语音合成提供了一个有前途的解决方案.
- 这种方法成功地集成了散音建模和扩散模型,用于增强语音生成.


