电话级别伯特为文本转换语音的增强形式与字母预测
Yinghao Aaron Li1, Cong Han1, Xilin Jiang1
1Department of Electrical Engineering, Columbia University, USA.
概括
我们开发了一种语音级别的BERT (PL-BERT) 来增强文本到语音 (TTS) 模型. 这种方法显著提高了合成语音的自然性,特别是对于未见的文本,优于当前的方法.
科学领域:
- 语音合成 语音合成
- 自然语言处理自然语言处理.
- 机器学习 机器学习
背景情况:
- 预先训练有素的语言模型可以提高文字转化为语音 (TTS) 的自然性.
- 目前的模型运行在单词或上音符层面,对以音符为重点的TTS无效.
- 语音层次的表示对于TTS中细粒度的前音控制至关重要.
研究的目的:
- 为TTS提出一个高效的语音级别BERT (PL-BERT).
- 为了提高合成语音的自然性和修辞性.
- 解决当前模型对音频级TTS任务的低效性.
主要方法:
- 开发了一个音频级别的BERT (PL-BERT) 架构.
- 引入了一个借口任务,涉及图形预测与掩盖的语音预测一起.
- 进行主观评估,使用语音自然度的平均意见分数 (MOS) 进行主观评估.
主要成果:
- 普勒伯特显著提高了合成语音的自然性.
- 与最先进的StyleTTS基线相比,获得了更高的MOS分数.
- 在OOD文本上已证明有效.
结论:
- 语音层次的BERT是一种有效的方法,可以增强TTS的自然性.
- PL-BERT为TTS提供了一种高效和改进的替代词级模型.
- 拟议的方法显示了对不同文本的强大概括能力.
更多相关视频
09:09Foreign Accent and Forensic Speaker Identification in Voice Lineups: The Influence of Acoustic Features Based on Prosody
Published on: September 27, 2024
472
05:38Interaction between Phonological and Semantic Processes in Visual Word Recognition using Electrophysiology
Published on: June 29, 2021
2.4K
