从非结构化的诊所信件中提取与有关的信息,使用大型语言模型
Shichao Fang1,2,3, Ben Holgate1,2,3, Anthony Shek2,3
1Department of Basic & Clinical Neuroscience, King's College London, London, UK.
Epilepsia
|July 10, 2025
概括
大型语言模型 (LLM) 可以有效地从电子健康记录 (EHR) 中提取的信息. 拉玛2 13b在识别类型,类型和抗药物方面表现出卓越的表现.
科学领域:
- 医疗信息学 医疗信息学
- 自然语言处理自然语言处理.
- 的研究研究.
背景情况:
- 电子健康记录 (EHR) 包含有价值的非结构化数据,用于医疗保健研究.
- 使用人工智能从临床笔记中提取特定的相关信息仍然是一个尚未探索的领域.
- 大型语言模型 (LLM) 为高级医学数据提取提供了潜力.
研究的目的:
- 为了比较和应用开源的LLMs来从非结构化的诊所信件中提取关键信息.
- 优化使用电子健康记录作为研究的数据资源.
- 评估不同LLM和提取方法的性能.
主要方法:
- 使用了280封注释的诊所信件的数据集.
- 探索开源的LLM (Llama和Mistral系列) 直接,总结和上下文的提取方法.
- 采用了角色提示和少数射击提示技术.
- 评估性能与黄金标准,微调模型和人类注释相比.
主要成果:
- 拉玛2 13b获得了卓越的提取性能 (F1分数:类型 .80,发作类型 .76,ASMs .90).
- 直接提取在LLM中始终表现出高性能.
- 在提取相关信息方面,LLMs的表现优于MedCAT,得分为0.2 F1.
结论:
- 在研究中,LLM显示了准确的医学信息提取的巨大潜力.
- 方法选择对于优化LLM在从非结构化临床文本中提取数据的性能至关重要.
- 这种方法通过先进的NLP来增强医学研究和患者护理.
更多相关视频
09:57Author Spotlight: Advancing Pediatric Epilepsy Surgery in Children Through Novel Biomarkers and Enhanced Localization
Published on: September 20, 2024
2.8K
07:50A Metadata Extraction Approach for Clinical Case Reports to Enable Advanced Understanding of Biomedical Concepts
Published on: September 20, 2018
16.0K
