从使用ChatGPT在急性缺血性中风中进行机械血栓切除的自由文本报告中提取数据:回顾性分析
Nils C Lehnen1, Franziska Dorn1, Isabella C Wiest1
1From the Department of Neuroradiology, University Hospital Bonn, Rheinische Friedrich-Wilhelms-Universität Bonn, Venusberg-Campus 1, 53127 Bonn, Germany (N.C.L., F.D., A.R., D.P.); Research Group Clinical Neuroimaging, German Center for Neurodegenerative Diseases (DZNE), Bonn, Germany (N.C.L., A.R.); Department of Medicine II, Medical Faculty Mannheim, Heidelberg University, Mannheim, Germany (I.C.W.); Else Kroener Fresenius Center for Digital Health, Medical Faculty Carl Gustav Carus, Technical University Dresden, Dresden, Germany (I.C.W., J.N.K.); Institute of Neuroradiology, University Hospital, LMU Munich, Munich, Germany (H.Z.); and Department of Radiology, Brigham and Women's Hospital, Harvard Medical School, Boston, Mass (D.P.).
像GPT-4这样的大型语言模型 (LLM) 可以准确地从中风报告中提取机械血栓切除数据,比手工方法提高效率. 与GPT-3.5相比,GPT-4在这个关键任务中表现出更高的性能.
科学领域:
- 医疗信息学 医疗信息学
- 人工智能在医学中的应用
- 神经辐射学神经辐射学
背景情况:
- 机械血栓切除报告中的程序细节对于中风结果预测和研究至关重要.
- 从这些报告中手动提取数据是耗时且容易出现错误的.
- 开发用于数据提取的自动化方法对于中风注册和研究至关重要.
研究的目的:
- 评估大型语言模型 (LLM) 的有效性,特别是GPT-4和GPT-3.5,用于从缺血性中风患者的机械血栓切除报告中提取程序数据.
- 将GPT-4和GPT-3.5的性能与人类专家标准进行比较.
主要方法:
- 进行了对来自机械血栓切除手术的100份内部和30份外部神经放射学报告的回顾性分析.
- 一组20个报告被用于快速优化.
- 在每份报告中提取28个数据点时,GPT-4和GPT-3.5的准确性与干预神经放射学家手动提取的数据进行了评估.
主要成果:
- 在所有报告中,GPT-4从2800条条目中提取数据,达到94.0%的准确率,明显超过GPT-3.5的63.9%准确率 (P < .001).
- 对于外部报告,GPT-4提取了90.5%的正确数据点,而GPT-3.5提取了64.2%.
- GPT-4不需要后处理,而GPT-3.5的性能在数据类别之间差异很大.
结论:
- GPT-4在从缺血性中风的自由文本机械血栓切除报告中提取程序数据方面表现出高水平的准确性和效率.
- 在准确提取这些关键临床信息方面,GPT-4显著超过了GPT-3.5.
- 在中风研究和注册表中,LLM,特别是GPT-4显示出对自动化数据收集的前景.


