从使用自然语言处理的临床笔记中识别胰腺癌风险因素
Dhruv Sarwal1, Liwei Wang2, Sonal Gandhi1
1Department of Gastroenterology and Hepatology, Mayo Clinic, Rochester, MN, USA.
概括
使用自然语言处理 (NLP) 从临床笔记中自动提取胰腺管腺癌 (PDAC) 风险因素是高度敏感的. 这种方法有助于识别PDAC查的高风险个体.
科学领域:
- 在瘤学瘤学.
- 医疗信息学 医疗信息学
- 计算生物学 计算生物学
背景情况:
- 胰腺管道腺癌 (PDAC) 查的目标是高危人群 (HRIs).
- 识别HRIs依赖于对家族史和生殖系突变等风险因素的准确评估.
- 目前的方法涉及手动查看图表,这耗时且取决于提供商.
研究的目的:
- 开发和评估自然语言处理 (NLP) 算法,从非结构化的电子健康记录 (EHR) 中自动提取PDAC风险因素.
- 提高用于PDAC查的HRIs识别的效率和准确性.
主要方法:
- 开发基于规则的NLP算法,用于文档级提取PDAC风险因素.
- 在患者层面对NLP算法进行培训,验证和测试,使用1138名患者队列.
- 确定算法回忆的优先级,以尽量减少识别风险因素的错误负结果.
主要成果:
- 在807名患者的测试组中,NLP算法实现了0.933的回忆和0.856的F1得分,用于PDAC家族史.
- 对于生殖系遗传突变,该算法显示高回忆率 (0.851),但精度较低 (0.350) 和F1得分 (0.496).
- 对生殖系突变的错误阳性结果的很大一部分源于组织突变的错误识别.
结论:
- 基于规则的NLP有效和灵敏地从非结构化的临床笔记中识别PDAC风险因素.
- 这些发现支持NLP的实用性,用于用于胰腺癌查的HRIs的自动识别.
- 建议在大型初级保健群体进行进一步验证,以确认现实世界的适用性.


