基于超声波舌头图像的端到端普通话语音重建,使用深度学习
概括
这项研究使用超声波舌头图像和深度学习重建了喉切除术患者的语音. 该方法在恢复明确的普通话语音方面显示出有希望的结果,有助于语音康复.
科学领域:
- 生物医学工程 生物医学工程
- 语音科学 语言科学
- 人工智能的人工智能
背景情况:
- 喉腔切除术经常导致言语丧失,造成严重的痛苦.
- 喉切除术中完整的关节器官突出显示了语音康复的潜力.
- 利用发音运动信息是恢复语音功能的关键.
研究的目的:
- 开发一种基于深度学习的方法,从超声波舌头图像进行语音重建.
- 为了恢复经过喉腔切除术的个体的可理解的言语.
- 为了利用表达运动数据用于语音康复.
主要方法:
- 采集了使用普通话语体的同时超声波舌头图像和语音数据.
- 使用对抗神经网络开发了一个端到端的语音重建模型.
- 整合了预训练的特征提取器,升级采样块和语音生成和保真性的歧视器.
主要成果:
- 重建的语音显示了普通话语音和音调的高度可理解性.
- 取得了0.2544的音符错误率和0.1784.4的音调错误率.
- 客观和主观评估证实了重建的演讲的高度相似性和可接受的自然性.
结论:
- 拟议的深度学习方法可以从超声波舌头图像中重建音调的普通话语音.
- 这些发现支持了喉切除患者语音康复的潜力.
- 未来的工作重点应该是优化模型,以满足特定的喉状况,并扩大数据集.


