基于特征的音频录像价值估计器 (FAVE):从手写音频录像的扫描图像中估计数字值
Paul G Mayo1, Kenneth I Vaden2, Lois J Matthews2
1Department of Hearing and Speech Sciences, University of Maryland, College Park, MD, 20742, USA. paulmayo@umd.edu.
Journal of medical systems
|February 26, 2025
概括
研究人员开发了机器学习模型,从手写的音频记录中提取听力数据. 这一创新使得关键的听力损失信息可用于公共卫生研究.
科学领域:
- 听力学 听力学是指听力学.
- 公共卫生 公共卫生
- 机器学习 机器学习
背景情况:
- 听力损失是一个重要的全球公共卫生问题.
- 纯音调听力测量产生音频图,对于评估听力敏感度至关重要.
- 从手写的音频录像中手动提取数据,阻碍了研究的可访问性.
研究的目的:
- 开发机器学习模型,从扫描的手写音频图片中估计数值听力值.
- 改善用于公共卫生研究的音频录像数据的可访问性.
主要方法:
- 开发了基于特征的音频图像价值估计器 (FAVE) 模型,使用汇总频道特征.
- 在556个手写音频录像中训练模型,这些音频录像来自于与年龄相关的听力损失的纵向研究.
- 使用符号位置回忆/精度和数值值估计错误评估模型准确性.
主要成果:
- 在符号位置方面,FAVE实现了87.0%的回忆率和96.2%的精度.
- 78.3%的估计数值值没有错误,与真实值没有显著差异.
- 在这个数据集上,值估计的准确性超过了预先训练的深度学习方法.
结论:
- 像FAVE这样的机器学习模型可以有效地从手写的音频记录中提取数值数据.
- 这种方法提高了历史音频录像数据对公共卫生研究的有用性.
- 未来的工作应该完善符号和轴标签的检测能力.


