在基于德语语言的自由文本和结构化放射学报告的LI-RADS评分确定中,ChatGPT的准确性很低
Philipp Fervers1, Robert Hahnfeldt1, Jonathan Kottlors1
1Department of Diagnostic and Interventional Radiology, University Cologne, Faculty of Medicine and University Hospital Cologne, Cologne, Germany.
Frontiers in radiology
|July 22, 2024
概括
像ChatGPT这样的大型语言模型在使用MRI报告对肝病变的分类中显示出有限的准确性. 然而,它们与非结构化报告显示出更好的一致性,这表明处理放射性数据的潜力.
科学领域:
- 放射学中的人工智能
- 医疗信息学 医疗信息学
- 机器学习用于医学成像
背景情况:
- 肝脏成像报告和数据系统 (LI-RADS) 对于在MRI上分类肝脏病变至关重要.
- 评估大型语言模型 (LLM) 用于自动化LI-RADS分类的可行性是一个新兴领域.
- 对结构化与非结构化放射学报告的LLM性能进行比较对于理解它们的临床实用性至关重要.
研究的目的:
- 根据MRI报告,评估ChatGPT (大型语言模型) 在使用LI-RADS标准对肝病变进行分类时的准确性.
- 将ChatGPT的分类性能与结构化和非结构化的MRI报告进行比较.
- 评估ChatGPT的LI-RADS分类的可靠性和一致性,并与专家放射科医生达成共识.
主要方法:
- 包括205个MRI报告 (来自150名患者) 具有可分类的肝病变,符合尺寸,位置和动脉相增强的最低标准.
- 使用ChatGPT (GPT-3.5) 来从结构化和非结构化德国MRI报告的发现部分中确定LI-RADS分数.
- 评估使用科恩的卡帕和测试-重新测试可靠性的协议,使用50个病变的子集的类内相关系数 (ICC).
主要成果:
- 在LI-RADS分类中,ChatGPT的准确性较差 (53%的非结构化报告,44%的结构化报告).
- 与专家的共识达成一致程度中等 (非结构化的kappa为0.51,结构化的kappa为0.44).
- 与结构化报告相比,ChatGPT显示了更高的测试重试可靠性 (ICC=0.81) 和较低的非结构化报告的平均绝对误差,尽管结构化报告更频繁地包含所需的成像功能.
结论:
- 在直接从肝脏MRI报告中进行LI-RADS评分时,ChatGPT的准确性较低.
- 自由文本 (非结构化) 报告的优异性能可能源于ChatGPT对各种文本数据的广泛培训.
- 虽然LLM需要对结构化临床数据进行优化,但从大型自由文本放射学数据库中生成机器可读的标签是有前途的.
更多相关视频
07:57Positron Emission Tomography-based Dose Painting Radiation Therapy in a Glioblastoma Rat Model using the Small Animal Radiation Research Platform
Published on: March 24, 2022
2.8K
10:33Expedited Radiation Biodosimetry by Automated Dicentric Chromosome Identification ADCI and Dose Estimation
Published on: September 4, 2017
15.7K
