从自由文本放射学报告中提取信息的开源大语言模型的性能
Bastien Le Guellec1, Alexandre Lefèvre1, Charlotte Geay1
1From the Department of Neuroradiology (B.L.G., A.L., C.B., J.P.P., G.K.), Department of Public Health (B.L.G., P.A., A.H.), and INclude Health Data Warehouse (C.G., L.S.), CHU Lille-Université Lille, Rue Emile Laine, 59000 Lille, France; Department of Radiology, UC Davis Health, Sacramento, Calif (L.H.B.); Université Lille, INSERM, CHU Lille, Institut Pasteur de Lille, U1167-RID-AGE - Facteurs de risque et déterminants moléculaires des maladies liées au vieillissement, Lille, France (P.A., A.H.); INSERM, U1172-LilNCog-Lille Neuroscience & Cognition, Université Lille, Lille, France (J.P.P., G.K.); and UAR 2014-US 41-PLBS-Plateformes Lilloises en Biologie & Santé, Université Lille, Lille, France (J.P.P., G.K.).
一个开源的大型语言模型 (LLM) 准确地从紧急大脑MRI报告中提取信息. 这种人工智能工具在识别关键细节方面表现出很高的表现,而无需事先的具体培训.
科学领域:
- 放射学中的人工智能
- 医疗报告的自然语言处理.
- 医疗保健中的机器学习
背景情况:
- 紧急的大脑MRI报告包含了关键的信息,为患者的护理.
- 从这些报告中手动提取数据是耗时且容易出现错误的.
- 大型语言模型 (LLM) 显示了从临床文本中自动提取信息的潜力.
研究的目的:
- 评估当地开源LLM (Vicuna) 在从紧急大脑MRI报告中提取数据方面的表现.
- 评估LLM在识别正常/异常发现,引起头痛与偶然异常以及对比介质使用方面的准确性.
主要方法:
- 从法国四级中心 (2022) 获得的2398份紧急大脑MRI报告的回顾性审查.
- 放射科医生确定了头痛的征兆,并对发现进行了分类 (正常/异常,引起头痛/偶然).
- 开源的LLM Vicuna执行了相同的信息提取任务;性能与放射科医生的共识进行了基准测试.
主要成果:
- 该LLM在检测头痛背景 (98.0%/99.3%),对比度使用 (99.4%/98.6%) 和报告分类 (96.0%/98.9%) 中实现了高灵敏度和特异性.
- 在MRI发现和头痛之间的因果推断的性能是88.2%的灵敏度和73%的特异性.
- 该LLM在不需要对此特定数据集进行额外培训的情况下表现出卓越的准确性.
结论:
- 一个开源的LLM可以有效地从自由文本的紧急大脑MRI报告中提取信息.
- 该LLM在各种信息提取任务中显示出高精度,支持其潜在的临床实用性.
- 这证明了使用易于使用的LLM来自动分析放射学报告的可行性.


