开发一种自然语言处理模型来推导乳腺癌质量指标:一个横截面的多中心研究
Etienne Guével1, Sonia Priou2, Rémi Flicoteaux3
1Assistance Publique - Hôpitaux de Paris, Innovation and Data, IT Department, 75012 Paris, France.
概括
使用电子健康记录自动化医疗保健质量指标面临挑战. 数据源可用性和自然语言处理算法性能限制自动指标计算.
科学领域:
- 医疗信息学 医疗信息学
- 医疗数据分析 医学数据分析
- 提高质量 提高质量
背景情况:
- 医疗行政数据为自动计算医疗保健质量和安全指标 (HQSI) 提供了潜力.
- 然而,现有的数据来源往往不足以计算所有相关指标.
- 本研究研究了利用多个数据源和自然语言处理 (NLP) 增强HQSI计算的可行性.
研究的目的:
- 评估HQSI计算数据源的可用性.
- 为了确定HQSI计算所需的基本变量的可用性.
- 应用NLP技术从医疗报告中自动提取数据.
主要方法:
- 一项多中心,横截面的观察性研究是使用来自巴黎公共医院 (AP-HP) 的数据进行的.
- 乳腺癌患者数据 (2019年1月至2021年6月) 用PMSI索赔数据和病理学报告进行分析.
- 基于规则的NLP算法被开发和验证以从自由文本病理学报告中提取数据,其性能指标包括回忆,精度和F1分数.
主要成果:
- 在5785名乳腺癌患者中,89.0%具有相关的PMSI数据,72.5%接受了手术.
- 仅使用PMSI数据就能计算出9个指标;另外6个指标可以使用病理学报告进行计算.
- NLP算法实现了平均准确率为76.5%,精度为77.7%,回忆率为71.6%,根据指标,可用于2%-88%的患者的可变提取.
结论:
- 医疗报告和其中的基本变量的可用性,以及NLP算法性能,限制了可以计算指标的患者数量.
- 从电子健康记录中自动计算质量指标存在重大实际障碍.


