为基于EEG的语音识别优化深度神经网络:辅助通信的多模式方法
IEEE journal of biomedical and health informatics
|December 8, 2025
概括
这项研究介绍了NeuroSpeech,NeuroSpeech是一个多式系统,结合了脑电图 (EEG) 和声学,以改善残疾人的语音识别. 即使在杂的环境中,NeuroSpeech也表现出强大的性能,提供了一个有前途的辅助技术.
科学领域:
- 神经科学是一个神经科学.
- 人工智能的人工智能
- 辅助技术 辅助技术 辅助技术
背景情况:
- 对于残疾人来说,语音识别是具有挑战性的,因为他们有非典型的语音模式.
- 传统的纯声学模型难以应对这些变化.
- 需要强大而高效的语音识别解决方案,以应对受影响的沟通.
研究的目的:
- 介绍NeuroSpeech,一个新的多式联络框架,集成脑电图 (EEG) 和声学特征.
- 为了提高语音识别准确性,稳定性和效率,对于有语音障碍的人来说.
- 调查EEG作为噪声强大的补充信号的作用.
主要方法:
- 开发了NeuroSpeech,这是一个结合EEG和声学特征的多式模式框架.
- 利用大规模的随机搜索来确定最佳的EEG编码器配置和特征提取参数.
- 采用可解释AI (XAI) 方法,特别是SHAP,用于模型解释性.
- 在干净和噪音条件下对西班牙语 (UNLP-CONICET) 和英语 (KaraOne) 数据集的评估性能.
主要成果:
- 在干净的条件下,NeuroSpeech实现了近乎完美的准确性 (F1=0.986西班牙语;0.837英语).
- 在噪音条件下保持强的性能 (F1=0.92西班牙语;0.70英语),优于Whisper等传统模型.
- 证明了EEG作为噪声强大的补充信号的有效性.
- 展示了NeuroSpeech的轻量级性质 (1-30M参数) 和近乎实时的推断 (10-18ms/样本).
结论:
- 通过整合神经和声学数据,NeuroSpeech显著改善了残疾人的语音识别.
- 该框架在杂的环境中提供了增强的稳定性,这是现实世界应用的关键因素.
- 神经语音代表了辅助技术的有希望的进步,使言语障碍患者能够更好地沟通.
更多相关视频
06:32Author Spotlight: Automated Deep Brain Stimulation for Parkinson's Disease - Exploring the Possibilities and Challenges of Home Monitoring
Published on: July 14, 2023
1.8K
09:47Author Spotlight: Advancing Alzheimer's Research – Exploring Early Detection and Multi-Omics Approaches
Published on: December 15, 2023
1.7K
