基于生成对立网络的舌头运动超声波图像的普通话语音重建
概括
研究人员利用超声波成像和人工智能从舌头运动中重建了普通话的语音. 这为喉切除术患者的语音康复提供了希望,实现了显著的语音和音调准确性.
科学领域:
- 生物医学工程 生物医学工程
- 人工智能的人工智能
- 语音科学 语言科学
背景情况:
- 喉腔切除术导致严重的语言障碍,导致痛苦.
- 在喉切除患者中,上声道的发音器通常是功能性的.
- 使用发音信息重建语音对于康复至关重要.
研究的目的:
- 开发一种方法来从动态舌头运动中重建音调的普通话语音.
- 为了利用超声波成像和深度学习来进行语音合成.
- 评估重建语音的质量和准确性.
主要方法:
- 创建了一个普通话语库,同时使用动态舌头超声图像和语音波形.
- 使用自动编码器从超声数据中提取特征.
- 使用生成对抗网络 (GAN) 来生成语音波形.
主要成果:
- 实现了72.43%的语音精度和76.10%的普通话音调精度.
- 重建的语音在mel-spectrogram和基本频率方面与原始语音具有很高的相似性.
- 主观评价表明言论的可接受性,平均意见分数>6.
结论:
- 一种新的方法从舌头运动超声波图像中重建音调的普通话语音.
- 这种方法显示了在喉切除患者的语音康复的潜力.
- 未来的工作应该集中在模型优化和数据集扩展上.


