从放射学报告中提取基于LLM的成像特征:在克罗恩病中自动化疾病活动评分
Reza Dehdab1, Fiona Mankertz1, Jan Michael Brendel1
1Department of Radiology, Tuebingen University Hospital, University of Tuebingen, Tuebingen, Germany (R.D., F.M., J.M.B., N.M., S.A.).
Academic radiology
|August 9, 2025
概括
大型语言模型 (LLM) 准确地从磁共振肠道图 (MRE) 报告中提取克罗恩病 (CD) 活动数据. 这种自动化方法有助于监测疾病进展和研究,而不会改变当前的工作流程.
科学领域:
- 医学成像分析分析 医学成像分析
- 医疗保健中的人工智能
- 胃肠病学研究的研究.
背景情况:
- 克罗恩病 (CD) 活动使用简化磁共振活动指数 (sMARIA) 评分系统进行评估.
- 磁共振输入学 (MRE) 报告包含sMARIA评分的关键数据,但通常是自由文本.
- 从自由文本放射学报告中提取结构化数据在临床实践中是一个挑战.
研究的目的:
- 评估两个先进的大型语言模型 (LLM) 在从MRE报告中提取关键图像特征的性能.
- 评估LLM根据提取的MRE发现计算sMARIA分数的能力.
- 为了确定与放射科医生注释相比,LLM驱动的sMARIA得分计算的准确性和可靠性.
主要方法:
- 对来自CD患者的117份匿名的MRE自由文本报告进行了回顾性分析.
- 使用ChatGPT (GPT-4o) 和DeepSeek (DeepSeek-R1) 与结构化提示提取四个sMARIA相关的特征:肠壁厚度,壁,周肠脂肪,以及.
- 将LLM输出与专家放射科医生的注释在细分和特征层面进行比较,使用准确性,MAE,皮尔森相关性,灵敏度,特异性,精度和F1分数等指标.
主要成果:
- 聊天GPT表现出高性能,98.6%的细分级准确度,0.17 MAE和0.99的皮尔森相关性.
- 深度搜索也显示出强的结果,准确率为97.3%,MAE为0.51,相关性为0.96.
- 在功能层面上,ChatGPT获得了98.8%的F1评分,而DeepSeek获得了97.9%的F1评分.
结论:
- 在从自由文本MRE报告中提取结构化临床信息和计算sMARIA分数方面,LLM表现出接近人类的准确性.
- 通过LLM自动化sMARIA评分可以促进CD活动评估,支持纵向监测和大规模研究.
- 未来将其纳入临床决策支持系统是可行的,只要有适当的人类监督和验证.
更多相关视频
07:15Machine Learning Algorithms for Early Detection of Bone Metastases in an Experimental Rat Model
Published on: August 16, 2020
6.9K
04:09Predicting Treatment Response to Image-Guided Therapies Using Machine Learning: An Example for Trans-Arterial Treatment of Hepatocellular Carcinoma
Published on: October 10, 2018
8.3K
