SPELL-LLMs:一个可扩展和符合隐私的NLP管道,使用本地托管的大型语言模型用于临床信息提取
medRxiv : the preprint server for health sciences
|August 8, 2025
概括
本研究介绍了一种保护隐私的自然语言处理 (NLP) 工作流,可以有效地从电子健康记录 (EHR) 中提取结构化数据. 混合方法显著加快了分析速度,并提高了临床研究数据的可用性.
科学领域:
- 生物医学信息学 生物医学信息学
- 自然语言处理自然语言处理.
- 健康 数据科学 数据科学
背景情况:
- 电子健康记录 (EHR) 为研究提供了丰富的数据,但由于非结构化的注释,异质性和缺失的信息,它们的使用具有挑战性.
- 从临床叙述中提取结构化的见解对于推动临床研究和决策至关重要.
- 现有的方法往往难以应对非结构化EHR数据的规模和复杂性.
研究的目的:
- 开发一个可扩展和维护隐私的自然语言处理 (NLP) 工作流程,从大量非结构化EHR数据中提取结构化的临床见解.
- 与传统方法相比,提高临床数据提取的效率和准确性.
- 为各种机构设置创建一个适应性强,计算效率高的平台.
主要方法:
- 一种混合NLP方法,将正则表达式 (regex) 结合起来用于片段识别和本地托管的大型语言模型 (LLM) 进行解释.
- 安全的内部数据处理,以确保严格遵守隐私法规.
- 一个基于Python的模块化工作流,旨在提高各机构的计算效率和适应性.
主要成果:
- 该NLP管道处理了数百万份临床报告,与全文LLM推断相比,处理时间显著减少了80%,与手动注释相比,减少了97%.
- 在提取数值,日期和诊断 (例如,HELLP综合征) 中获得了高精度,与专家注释达成95%的一致.
- 该工作流通过在公共数据集中准确识别腹腔动脉高心率来证明可通用性.
结论:
- 开发的混合NLP框架大大提高了非结构化EHR数据的实用性.
- 这种方法支持大规模的回顾性分析,临床研究和决策支持系统.
- 保护隐私,高效和适应性的工作流程有助于在医疗保健中更广泛地使用临床叙述.


