评估本地开源大语言模型,从缺血性中风患者机械血栓切除术的非结构化报告中提取数据
Aymen Meddeb1,2, Philipe Ebert3, Keno Kyrill Bressem4
1Department of Neuroradiology, Charité Universitätsmedizin Berlin, Berlin, Germany aymen.meddeb@charite.de.
Journal of neurointerventional surgery
|August 2, 2024
概括
开源大型语言模型 (LLM) 显示出从机械血栓切除报告中提取临床数据的前景. 结合LLMs与人入循环 (HITL),提高了准确性,并大大节省了用于中风研究的数据提取时间.
科学领域:
- 人工智能的人工智能
- 医疗信息学 医疗信息学
- 临床研究 临床研究
背景情况:
- 评估开源大语言模型 (LLM) 对于从机械血栓切除报告中提取临床数据的有效性.
- 专注于因血管封闭而患有缺血性中风的患者.
研究的目的:
- 评估当地的开源LLMs在提取关键临床数据点方面的表现.
- 为了比较自动数据提取与手动数据提取的效率,使用人入循环 (HITL) 方法.
主要方法:
- 在机械血栓切除报告的机构和外部数据集上部署了三种LLM (Mixtral,Qwen,BioMistral).
- 使用HITL进行地面真实标签和记录时间指标进行数据提取.
- 在15个临床类别中根据精度,回忆和F1得分评估模型性能.
主要成果:
- 混合测试显示了高精度 (0.99为第一个系列时间).
- 通过HITL方法,每个案例平均节省了65.6%的时间.
- 性能因模型和数据类别而异,NIHSS分数和封闭容器显示出不同的提取精度.
结论:
- 从非结构化医疗报告中提取自动化临床数据,LLM具有显著的潜力.
- 集成HITL可以提高数据的准确性和可靠性,支持临床文档和研究.
- 这种保护隐私的方法是医疗数据管理的可扩展解决方案.


