开发可访问的助听技术,用于聋人和听障者,通过部署一个微调深度神经网络到Web
概括
这项研究开发了一种深度学习模型和移动应用程序,用于检测聋人和听力障碍者关键声音. 该系统准确地分类警报和汽车喇等声音,提高日常安全.
科学领域:
- 计算机科学 计算机科学
- 人工智能的人工智能
- 信号处理 信号处理
背景情况:
- 之前的研究已经为聋人和听力障碍者确定了关键声音,但缺乏移动应用程序.
- 现实世界声音分类需要区分目标声音与无关的背景噪声.
研究的目的:
- 开发一个深度神经网络和移动应用程序,用于对聋人和听力障碍者相关的五个关键声音类别进行分类.
- 通过整合"负"类来改进以前的模型,以提高现实世界的性能.
- 为移动设备创建一个可访问的实时声音检测应用程序.
主要方法:
- 微调 YamNet 音频分类模型,使用一种新的方法,使用长短期记忆 (LSTM) 来获得时间信息.
- 实现卷积层,以尽量减少实时移动使用的性能开销.
- 通过TensorFlow.js部署模型以实现Web和Progressive Web App (PWA) 的离线可访问性.
主要成果:
- 最终的模型实现了0.97 ± 0.01.01的高曲线下面积 (AUC).
- 证明了精确度和回忆的平衡,有效地处理关键和良性声音类别.
- 已成功部署为移动设备的基于Web和离线的Progressive Web App.
结论:
- 开发的深度学习模型和应用程序在改善聋人和听力障碍者情境意识方面显示出显著的前景.
- 新的微调方法和移动优化对于实时音频事件检测是有效的.
- 建议进行进一步的用户测试,以确保应用程序满足目标受众的特定需求.


