通过快速工程改进临床命名实体识别的大型语言模型
Yan Hu1, Qingyu Chen2,3, Jingcheng Du1
1McWilliams School of Biomedical Informatics, Houston, TX, United States.
Journal of the American Medical Informatics Association : JAMIA
|January 28, 2024
概括
像GPT-4这样的大型语言模型 (LLM) 对临床命名实体识别 (NER) 任务显示出希望. 特定任务提示显著提高了LLM的性能,减少了在医疗保健中需要大量注释数据的需求.
科学领域:
- 人工智能的人工智能
- 自然语言处理自然语言处理.
- 生物医学信息学 生物医学信息学
背景情况:
- 大型语言模型 (LLM) 显示了处理复杂临床数据的潜力.
- 临床命名实体识别 (NER) 对于从电子健康记录中提取信息至关重要.
- 当前的方法往往需要大量的注释数据集,限制了可扩展性.
研究的目的:
- 评估GPT-3.5和GPT-4在临床NER任务上的性能.
- 开发和评估特定任务的快速框架,以提高临床环境中的LLM能力.
- 为了比较LLM的表现与已建立的模型,如BioClinicalBERT.
主要方法:
- 进行了两个临床NER任务:从MTSamples提取概念,并从VAERS识别不良事件.
- 开发了一个提示框架,包括基线,指导方针,基于错误分析和少量学习提示.
- 用放松的F1分数评估模型性能,并与BioClinicalBERT进行比较.
主要成果:
- 通过特定任务的提示框架,GPT-3.5和GPT-4的性能显著提高.
- 使用所有提示组件,GPT-4获得了0.861 (MTSamples) 和0.736 (VAERS) 的F1分数.
- 虽然LLM的表现没有超过BioClinicalBERT,但它在最小的培训数据下显示出有希望的结果.
结论:
- 特定任务提示提高了临床NER的LLMs的可行性.
- 实际上,LLM,特别是GPT-4,显示出接近最先进的性能与精心及时工程的潜力.
- 需要进一步的研究和完善的评估方案,才能在临床应用中充分利用LLM.


