语音音频合成从标记的MRI和非负矩阵因子化通过塑料变压器
Xiaofeng Liu1, Fangxu Xing1, Maureen Stone2
1Massachusetts General Hospital and Harvard Medical School, Boston, MA, USA.
概括
这项研究引入了一个深度学习框架,将舌头运动数据 (权重图) 转换为语音音频. 塑料光变压器 (PLT) 模型有效地从舌头运动模式中合成现实的语音波形.
科学领域:
- 语音制作和声学研究
- 生物医学工程 生物医学工程
- 机器学习用于信号处理.
背景情况:
- 舌头的3D结构和局部功能单元对于语音产生至关重要.
- 标签:MRI揭示了语言功能单元在演讲过程中的凝聚力移位.
- 非负矩阵因子化从运动数据中估计舌头的功能单位和权重图.
研究的目的:
- 调查舌头功能单元权重图和语音声学之间的关系.
- 开发一种深度学习模型,将舌头运动权重图转化为音频波形.
- 从有限的训练数据中增强合成语音音频的真实性.
主要方法:
- 开发了一个端到端的深度学习框架,塑料光变压器 (PLT).
- PLT利用定向产品相对位置偏差和空间金字塔聚合来处理可变大小的输入.
- 使用对智的发言一致性与最大平均差异和对抗性训练来提高光谱现实性.
主要成果:
- PLT框架成功地从舌头权重图表中合成了语音音频波形.
- 与传统的卷积和变压器模型相比,拟定的框架显示出更高的性能.
- 该模型实现了对权重图的灵活处理,没有信息丢失或维度扩展.
结论:
- 深度学习,特别是PLT框架,提供了一种可行的方法,可以从舌头运动数据中合成语音.
- 通过这种方法,可以更好地理解舌头运动模式和语音声学之间的联系.
- 开发的框架显示了语言分析和语音合成应用的前景.


