大型语言模型可以降低从电子健康记录中提取数据用于研究的成本吗?
medRxiv : the preprint server for health sciences
|January 16, 2026
概括
大型语言模型 (LLM) 可以使自然语言处理 (NLP) 对较小的医疗数据项目具有成本效益. 与传统的NLP方法相比,这种方法减少了开发时间,但计算成本需要管理.
科学领域:
- 生物医学信息学 生物医学信息学
- 计算语言学 计算语言学
背景情况:
- 非结构化的电子健康记录 (EHR) 包含有价值的医疗数据.
- 从EHR中提取信息通常是手动或通过自然语言处理 (NLP) 完成的.
- 目前的NLP方法仅对大型数据集 (约6500条记录) 具有成本效益.
研究的目的:
- 调查大型语言模型 (LLM) 是否可以降低较小的EHR项目的NLP成本.
- 评估基于LLM的NLP框架的准确性和可行性.
主要方法:
- 使用开源LLM开发了一个NLP管道,从EHR中提取乳腺癌生物标志物数据 (ER,PR,HER2).
- 将LLM管道的开发时间和性能与基于规则 (RB) 的NLP管道进行比较.
- 将LLM管道代码公开提供.
主要成果:
- 该LLM管道实现了与手动数据提取具有竞争力的性能.
- 对LLM管道的实践开发时间约为RB管道的38%.
结论:
- 与传统的NLP技术相比,LLM的实践开发成本较低.
- 法律法规需要大量的计算资源,这可能是昂贵的.
- 如果计算费用得到管理,LLM显示了使NLP在较小的EHR项目中经济可行性的潜力.


