深度学习模型的比较语音障碍分类使用kymographic图像
1Department of Biomedical Engineering, Sri Sivasubramaniya Nadar College of Engineering, Kalavakkam, Tamil Nadu, India.
Journal of voice : official journal of the Voice Foundation
|February 13, 2025
概括
这项研究引入了一种深度学习方法,可以使用kymographic图像自动分类语音障碍. DenseNet121实现了高精度,为临床医生提供了潜在的诊断工具.
科学领域:
- 医疗成像医学成像
- 人工智能的人工智能
- 语音科学 语言科学
背景情况:
- 通过高速视频 (HSV) 内镜诊断语音障碍是具有挑战性的,因为手动分析.
- 基摩графия通过可视化声振动来帮助临床决策.
- 自动化分析图像可提高诊断效率.
研究的目的:
- 开发和评估一种深度学习方法,用于自动地从kymographic图像中对语音障碍进行分类.
- 评估各种预训练的深度学习模型在检测病态振动模式方面的性能.
主要方法:
- 来自自自动眼膜细分 (BAGLS) 数据集的基准标准中的高速记录生成的基摩图像.
- 使用深度学习模型 (AlexNet,DenseNet121,Xception,Inceptionv3,ResNet50v2) 来进行二进制和三进制分类.
- 训练有素的模型来识别声音病理的微妙变异.
主要成果:
- 与其他评估模型相比,DenseNet121在分类语音障碍方面表现优异.
- 深度学习分类器实现了高准确性,并超过了现有方法.
- 该模型有效地检测到病理振动模式的复杂变化.
结论:
- 基于深度学习的基摩图像分类器,特别是DenseNet121,显示了自动化语音障碍诊断的巨大潜力.
- 这种自动化方法可以作为临床医生宝贵的诊断辅助工具.
- 进一步的研究可能会导致改善语音病理学的临床决策支持.


