基于机器学习的声严重性的估计,使用在高速视频内镜中记录的声学信号
Tobias Schraut1, Michael Döllinger1, Melda Kunduk2
1Division of Phoniatrics and Pediatric Audiology at the Department of Otorhinolaryngology, Head and Neck Surgery, University Hospital Erlangen, Friedrich-Alexander-Universität Erlangen-Nürnberg, 91054 Erlangen, Germany.
Journal of voice : official journal of the Voice Foundation
|January 4, 2025
概括
使用来自高速视频内镜 (HSV) 的声学信号的机器学习模型显示了评估声严重性的潜力. 然而,由于口腔喉检查的实际限制,语音治疗会话的录音更可靠.
科学领域:
- 喉腔病理学 喉腔病理学
- 语言病理学 语音病理学
- 生物医学工程 生物医学工程
- 机器学习 机器学习
背景情况:
- 评估声的严重程度对于诊断语音障碍至关重要.
- 机器学习为客观的语音分析提供了一个有希望的途径.
- 高速视频内镜 (HSV) 提供了详细的喉可视化,但其声学记录的用于声评估的实用性正在调查中.
研究的目的:
- 调查HSV期间记录的持续声调的有效性,用于基于机器学习的声严重性评估.
- 为了比较HSV衍生声学录音的性能与语音治疗课程的传统录音.
- 确定用于语音分析的HSV衍生声学数据的关键差异和局限性.
主要方法:
- 创建了一个数据库,包含HSV检查中的617个语音录音 (250毫秒).
- 对比数据库包括来自语音治疗会话的809个元音 (持续时间为1秒和250毫秒).
- 提取了490个声学特征,开发了机器学习模型,并根据专家的听觉感知等级对声的严重程度进行了分类.
主要成果:
- 后勤回归模型实现了0.863 (VT-1),0.847 (VT-2) 和0.742 (HS) 的分类精度.
- 预测和主观声得分之间的相关性为0.797 (VT-1),0.763 (VT-2) 和0.637 (HS).
- 与语音治疗记录相比,HSV记录 (0.088) 的定量和主观评级变化之间的相关性明显较低.
结论:
- 来自HSV的声学信号显示了定量声评估的潜力,但不如语音治疗记录那么可靠.
- 在口腔喉检查期间的实际挑战限制了HSV衍生声学录音的质量.
- 未来的改进,可能使用灵活的鼻腔内镜,可以提高HSV用于语音评估的实用性.


