从电子健康记录中的扫描音频图片中基于计算机视觉的结构化数据的提取
Ruoyu Yang1, Dana Mae Salvador2, Carl Ehrett1
1Watt Family Innovation Center, Clemson University, Clemson.
概括
一种新的计算机视觉 (CV) 方法从电子健康记录中的扫描音频图中准确地提取听力值数据. 这种方法可以为研究和临床支持进行大规模的听力损失分析.
科学领域:
- 医疗信息学 医疗信息学
- 计算机视觉 计算机视觉
- 听力学 听力学是指听力学.
背景情况:
- 电子健康记录 (EHR) 包含有价值的听力图数据,但通常是无结构的.
- 从传统的音频记录中提取结构化听力值数据是一项挑战.
- 准确的数据提取对于人口层面的听力研究和临床决策支持至关重要.
研究的目的:
- 开发和验证计算机视觉 (CV) 方法,从扫描的音频图片中提取结构化的听力值数据.
- 评估CV方法在估计频率和值方面的准确性.
- 为数字化历史音频录像数据提供可扩展的解决方案.
主要方法:
- 开发了一个基于轮的CV管道,以处理PDF格式的扫描音频图.
- 该管道包括图像裁剪,符号检测,轴标签识别 (OCR),坐标校准和符号数字化.
- 907个音频录像的数据集被用于开发,30个音频录像 (618个值) 用于对手工提取的地面真相数据进行验证.
主要成果:
- 电流管道的平均绝对误差为频率为136Hz,值为1.3dB HL.
- 对于没有面具的空气导通符号,确切的准确度超过了85%.
- 该方法成功地提取了纯色图的频率和值.
结论:
- 计算机视觉可以在没有深度学习的情况下,从扫描的音频图像中准确地提取纯色调值数据.
- 这种方法提供了一种可扩展的方式,可以将遗留的音频录像转换为结构化数据集.
- 该方法支持人口层面的听力研究,临床决策支持和流行病学监测.


