自动从PDF睡眠报告中提取数据,使用数据挖掘技术
Fábio Teixeira1,2, João Costa1, Pedro Amorim1
1University of Porto, Portugal.
Studies in health technology and informatics
|May 17, 2025
概括
本研究介绍了一个使用OCR和NLP的网络工具,从睡眠报告中提取超过75个数据点,达到100%的准确性. 这个应用程序简化了睡眠研究数据分析的医疗保健提供者和研究人员.
科学领域:
- 医疗信息学 医疗信息学
- 生物医学数据科学 生物医学数据科学
背景情况:
- 睡眠研究产生复杂的报告,需要专门的分析.
- 高效的数据提取和处理对于临床和研究应用至关重要.
- 目前分析睡眠研究数据的方法可能耗时且需要技术专业知识.
研究的目的:
- 开发和验证一个用于自动提取睡眠研究数据的网络应用程序.
- 为了简化处理和可视化来自多个睡眠报告的关键数据点.
- 为医疗保健提供者和研究人员提高睡眠研究数据的可访问性和可用性.
主要方法:
- 实现光学字符识别 (OCR) 管道用于文本提取.
- 应用自然语言处理 (NLP) 技术来识别和提取超过75个特定的数据点.
- 开发一个直观的网络界面,用于数据可视化和聚合.
- 提取管道的验证在40个睡眠报告的不同组合上.
主要成果:
- 该管道在从睡眠报告中提取有针对性的信息时实现了100%的准确性.
- 该系统成功处理了缺失数据和格式不一致的报告.
- 该网络应用程序提供了对个人和聚合睡眠研究数据的高效可视化.
- 睡眠数据分析所需的技术专业知识显著减少.
结论:
- 开发的Web应用程序有效地自动提取和分析睡眠研究数据.
- 该工具增强了用于阻断性睡眠呼吸暂停 (OSA) 报告分析的数据利用.
- 该应用程序使医疗保健提供者和研究人员能够有效访问关键的睡眠指标.
- 未来的工作重点是扩大分析能力和数据归算技术.


