MedPromptExtract (医疗数据提取工具):匿名化和高保真性自动数据提取使用自然语言处理和快速工程
Roomani Srivastava1, Lipika Bhat1, Suraj Prasad1
1Koita Centre for Digital Health, Indian Institute of Technology, Bombay, Mumbai, Maharashtra, India.
The journal of applied laboratory medicine
|March 29, 2025
概括
MedPromptExtract自动化了从出院总结中提取医疗数据,克服了低资源环境中的数字化挑战. 该工具有效地提取关键的患者信息,同时确保数据保密.
科学领域:
- 医疗信息学 医疗信息学
- 医疗保健中的人工智能
- 自然语言处理自然语言处理.
背景情况:
- 医疗记录的数字化受到从出院摘要 (DSs) 提取劳动密集型数据的阻碍,特别是在低收入和中等收入国家 (LMICs).
- 目前的方法需要大量的手工工作,减缓了向电子健康记录的过渡.
研究的目的:
- 介绍一下MedPromptExtract,这是一个完全自动化的方法,可以从DS中高效和保密地提取数据.
- 解决在资源有限的环境中医疗数据提取的挑战.
主要方法:
- 使用了先前存在的匿名化工具 (专家通知的联合学习aGgrEatioN - EIGEN) 和自然语言处理 (NLP).
- 使用Gemini Pro的提示工程和大型语言模型 (LLM) 来从自由流动的文本中提取定制的临床数据.
- 从KDAH患者的DS中提取了12个与急性损伤 (AKI) 相关的特征.
主要成果:
- 匿名化管道在3秒内处理了DS,每个摘要由临床医生核实.
- 该NLP管道从匿名的PDF文件中提取结构化文本,准确度为100%,每个摘要0.2秒.
- 该LLM管道实现了高保真性,在12个特征中,7个特征显示在临床注释上验证时曲线下面积 (AUC) 超过0.9.
结论:
- MedPromptExtract提供了一种自动化和可适应的解决方案,用于高效地提取医疗记录数据.
- 该工具具有动态的用户界面,增强其可用性和适用性在各种医疗保健环境.


