改进文本独立的强制对齐,以支持语音语言病理学家使用语音转录
Ying Li1, Bryce Johannas Wohlan1, Duc-Son Pham1
1School of EECMS, Curtin University, Bentley, WA 6102, Australia.
Sensors (Basel, Switzerland)
|December 23, 2023
概括
这项研究引入了一种自动语音转录模型,用于诊断语音障碍 (SSD). 这种新的方法提高了准确性,减少了语音分析中的偏见,有利于临床应用.
科学领域:
- 语言病理学 语音病理学
- 计算语言学 计算语言学
- 机器学习 机器学习
背景情况:
- 语音转录对于诊断语音音障碍 (SSD) 是至关重要的.
- 当前的强制对齐 (FA) 工具通常需要手动转录,并且容易产生偏差.
- 现有的FA工具的局限性阻碍了有效的语音模式诊断和分析.
研究的目的:
- 开发一种新的,文本独立的强制对齐模型,用于自动语音转录.
- 解决手动转录和感知偏差在SSD诊断中的局限性.
- 提高语音障碍评估的客观性和效率.
主要方法:
- 使用预训练的 wav2vec 2.0 模型进行自动语音分割和识别.
- 使用无监督细分工具 (UnsupSeg) 准确识别语音边界.
- 实现了近邻分类,连接式时间分类 (CTC) 和后处理以增强细分.
主要成果:
- 该模型实现了竞争性表现,在TIMIT数据集 (普通扬声器) 上,其和平均得分为76.88%.
- 首次,该模型在TORGO数据集 (SSD扬声器) 上进行了评估,达到70.31%的和平均得分.
- 在有言语声音障碍的扬声器上表现出有效的性能,这是一个关键的进步.
结论:
- 开发的模型在对SSD的客观和不那么偏见的评估方面取得了重大进展.
- 它与SSD扬声器的有效性为语音病理学开辟了新的研究和临床应用.
- 这种自动化方法有可能彻底改变语言障碍的诊断和治疗.


