一个基于大型语言模型的生成性自然语言处理框架,对临床笔记进行了微调,可以准确地从电子健康记录中提取头痛频率
Chia-Chun Chiang1, Man Luo2, Gina Dumkrieger3
1Department of Neurology, Mayo Clinic, Rochester, Minnesota, USA.
Headache
|March 25, 2024
概括
一个新的生成GPT-2模型准确地从临床笔记中提取头痛频率,优于传统的NLP方法. 这一进步有助于通过电子健康记录评估偏头痛治疗反应.
科学领域:
- 自然语言处理 (NLP) 是一种自然语言处理.
- 医疗保健中的机器学习
- 临床信息学 临床信息学
背景情况:
- 头痛的频率对于评估偏头痛治疗疗效至关重要.
- 从临床笔记中提取头痛频率是具有挑战性的,因为文档的变化.
- 传统的NLP算法与电子健康记录 (EHR) 中不一致的临床文档扎.
研究的目的:
- 开发一种自然语言处理 (NLP) 算法,从自由文本临床笔记中准确地提取头痛频率.
- 评估不同NLP框架的性能,包括GPT-2和ClinicalBERT,用于此任务.
主要方法:
- 两家三级头痛中心的1915年神经学咨询笔记的回顾性分析.
- 四个NLP框架的比较:临床BERT回归,GPT-2QA (零射击和少数射击) 和GPT-2生成 (少数射击).
- 模型进行了微调,并根据临床笔记进行了测试,以提取头痛频率.
主要成果:
- GPT-2生成模型以0.92准确度和0.89R2得分实现了最高的性能.
- 所有基于GPT-2的模型在完全匹配的准确性方面都超过了ClinicalBERT.
- 临床BERT回归显示精度较低 (0.27),但R2得分高 (0.88),预测频率在±3天内.
结论:
- 一个GPT-2生成模型有效地从EHR中提取头痛频率,克服文档不一致性.
- 与临床BERT相比,基于GPT-2的框架在这个特定的NLP任务中表现出更高的准确性.
- 开发的GPT-2模型和代码是开源的,以支持进一步的临床信息学研究.


