一个简化的对抗架构,用于跨主体的静音语音识别,使用电肌图学
Qiang Cui1,2,3, Xingyu Zhang1,2,3, Yakun Zhang1,2,3
1Defense Innovation Institute, Academy of Military Sciences (AMS), Beijing 100071, People's Republic of China.
Journal of neural engineering
|August 23, 2024
概括
这项研究引入了一种新的对抗网络,用于基于电肌图 (EMG) 的静音语音识别,显著提高了不同扬声器的准确性. 该方法有效地调整了语音特征,提高了跨主题场景中的表现.
科学领域:
- 生物医学工程 生物医学工程
- 信号处理 信号处理
- 机器学习 机器学习
背景情况:
- 基于电肌图 (EMG) 的静音语音识别面临挑战,原因是语音模式和生理学的个体变化.
- 现有的对抗网络对跨主体识别的分类器预测提供了有限的直接贡献.
- 功能对齐技术对于解决扬声器之间的域偏移至关重要.
研究的目的:
- 提出一个基于差异的简化对抗网络,以改进基于EMG的跨主题静音语音识别.
- 开发一个精简的端到端结构,增强跨学科的特征对齐.
- 克服当前在直接分类预测中的对抗性方法的局限性.
主要方法:
- 一个新的级联自适应整顿网络被用于从噪声强的肌电信号中提取前端特征.
- 为特征对齐引入了核规范瓦斯斯坦差异度量,用于分类和域区分.
- 网络适应性地重塑特征图,以过特定域信息并保留域不变特征.
主要成果:
- 在接受60名受试者的数据培训后,在40名新受试者身上获得了平均准确度为89.46%.
- 在20个培训对象的10个新对象上测试时,与最先进的模型相比,表现出10.07%的改进.
- 优于现有的方法,即使训练对象数量少得多.
结论:
- 拟议的基于差异的简化对抗网络显著增强了基于EMG的跨主题静音语音识别.
- 该方法有效地过了特定域的噪声,同时保留了关键的域不变特征.
- 这项工作为基于EMG的语音交互应用提供了有前途的进展.


