为患有抑郁症或帕金森病的患者开发专门的语音识别模型的策略,使用小型语音数据库
Seojin Yoon1, Seri Maeng2, Ryul Kim3
1Department of Electrical Engineering, Inha University, Incheon, 22212 Republic of Korea.
Biomedical engineering letters
|September 2, 2024
概括
这项研究介绍了m-Globalformer,这是一种新的语音识别模型,旨在提高抑郁症或帕金森病 (PD) 患者的准确性. 该模型利用全球语音信息,为这些患者群体实现较低的字符错误率.
科学领域:
- 语音识别技术 语音识别技术
- 计算语言学 计算语言学
- 生物医学信号处理
背景情况:
- 目前的语音识别模型在患有抑郁症或帕金森病 (PD) 的个体上表现不佳,原因是不同的语音模式.
- 较低的识别准确度限制了基于语音的服务对神经和心理疾病患者的有效性.
研究的目的:
- 开发一种先进的语音识别模型,以提高抑郁症或PD患者的准确性.
- 为这些患者群体提高语音识别服务的可用性和可靠性.
主要方法:
- 提出了m-Globalformer,这是一个增强的Globalformer架构,包含了一个修改后的挤压激发 (SE) 模块,以更好地利用全球语音信息.
- 采用预训练和微调策略,最初对大规模的正常语音数据集进行训练,然后对有限的患者数据进行微调.
- 专注于利用全球语音上下文而不是本地特征来提高识别准确性.
主要成果:
- 对于抑郁症患者的言语,m-Globalformer模型实现了11.28%的字符错误率 (CER).
- 该模型在帕金森病 (PD) 患者的演讲中获得了19.67%的CER.
- 与针对的患者群体的现有模型相比,表现出优异的性能.
结论:
- m-Globalformer模型显示,在患有抑郁症和PD的患者中,提高语音识别准确性的潜力显著.
- 利用全球语音信息和转移学习的方法对具有非典型语音模式的条件有效.
- 这一进步可以为患有特定健康状况的个人带来更容易获得和更准确的基于语音的技术.


