基于语音的帕金森病检测使用预训练的自主监督自动语音识别 (ASR) 模型和监督的对比学习
Hadi Sedigh Malekroodi1, Nuwan Madusanka2, Byeong-Il Lee1,2,3
1Industry 4.0 Convergence Bionics Engineering, Pukyong National University, Busan 48513, Republic of Korea.
Bioengineering (Basel, Switzerland)
|July 29, 2025
概括
这项研究表明,使用自动语音识别 (ASR) 模型的高级语音分析可以有效检测帕金森病 (PD). 微调的ASR模型与对比学习显著优于早期PD诊断的传统方法.
科学领域:
- 神经学 神经学
- 计算语言学 计算语言学
- 机器学习 机器学习
背景情况:
- 语音障碍是帕金森病 (PD) 的早期指标.
- 传统的PD诊断方法可能具有侵入性或缺乏早期检测的敏感性.
- 自动语音识别 (ASR) 模型为非侵入性PD评估提供了潜力.
研究的目的:
- 评估微调的预训练ASR模型 (Wav2Vec 2.0,HuBERT) 对帕金森病检测的有效性.
- 通过将监督对比 (SupCon) 学习与ASR模型集成来增强PD检测.
- 将ASR衍生特征与已确定的声学特征 (MFCC,eGeMAPS) 进行比较,并使用Grad-CAM评估模型的可解释性.
主要方法:
- 在用于PD检测的NeuroVoz数据集上微调Wav2Vec 2.0和HuBERT模型.
- 实施监督对比 (SupCon) 学习以改善特征歧视.
- 将ASR特征与Mel-frequency cepstral系数 (MFCCs) 和eGeMAPS进行比较.
- 使用Grad-CAM可视化语音区域对于PD预测至关重要.
主要成果:
- 预先训练的ASR模型在PD检测中显著超过了基线声学特征.
- SupCon学习方法始终比传统的交叉 (CE) 模型产生更好的结果.
- 与CE模型相比,Wav2Vec 2.0和HuBERT与SupCon实现了高F1得分 (90.0%和88.99%) 和更高的AUC值.
结论:
- 精心调整的ASR模型,特别是Wav2Vec 2.0和HuBERT与SupCon,显示了非侵入性PD检测的高精度.
- 基于ASR的语音分析为早期诊断和监测帕金森病提供了一个可扩展和有前途的工具.
- 集成先进的机器学习技术增强了语音分析在神经疾病评估中的潜力.


