从腰椎MRI放射学报告中提取信息,使用GPT4:准确性和对研究级综合评分进行基准测试
Katharina Ziegeler1, Virginie Kreutzinger1, Michelle W Tong1,2,3
1Department of Radiology and Biomedical Imaging, University of California San Francisco, San Francisco, CA 94143, USA.
Diagnostics (Basel, Switzerland)
|April 12, 2025
概括
大型语言模型 (LLM) 可以准确地从放射学报告中提取详细的腰椎病理数据. 虽然性能很好,但对专家评分的适度同意强调了需要改进的,不那么主观的基于机器的数据提取方法.
科学领域:
- 医学成像分析 医学成像分析
- 在医疗保健中的自然语言处理.
- 放射学 信息学 信息学
背景情况:
- 从腰椎MRI报告中提取标准化数据对于研究至关重要.
- 当前的方法可能是主观的,耗时的.
- 大型语言模型 (LLM) 为自动数据提取提供了一个潜在的解决方案.
研究的目的:
- 开发和评估基于LLM的管道,用于从腰椎MRI报告中标准化提取数据.
- 评估LLM提取数据与研究级半定量评分之间的一致性.
- 确定在基于LLM的脊柱病理数据提取方面需要改进的领域.
主要方法:
- 利用OpenAI的GPT-4的安全API部署,从临床放射学报告中提取病理学信息.
- 采用无监督的UMAP和聚合集群以实现快速优化.
- 使用F1分数,FPR和FNR对比LLM提取与人类提取.
- 在LLM提取的数据和使用科恩卡帕的专家放射科医生得分之间的计算一致性.
主要成果:
- 包括230名慢性腰部疼痛患者的数据.
- 取得了优秀的LLM总体表现,病理学提取平均F1得分为0.96.
- 在LLM提取的数据和专家得分之间观察到适度的一致性 (kappa 0.424).
- 发现侧腔静脉狭窄的报告不足 (FNR 63.6%) 和磁盘病理的过度报告 (FPR 42.7%).
结论:
- 在从放射学报告中提取详细的腰椎成像病理信息时,LLM的准确性很高.
- 对专家评分的适度同意表明需要进一步完善LLM提取方法.
- 基于机器的数据提取有望减少成像分析中的主观性.
更多相关视频
06:31Quantitative [18F]-Naf-PET-MRI Analysis for the Evaluation of Dynamic Bone Turnover in a Patient with Facetogenic Low Back Pain
Published on: August 8, 2019
7.2K
07:44Evaluation of Patients' Posture and Gait Profile After Lumbar Fusion Surgery by Video Rasterstereography and Treadmill Gait Analysis
Published on: March 23, 2019
17.5K
