深度学习胸部X射线解释模型的验证:集成大型AI和大型语言模型进行比较分析与ChatGPT
Kyu Hong Lee1, Ro Woon Lee1, Ye Eun Kwon1
1Department of Radiology, College of Medicine, Inha University, Incheon 22212, Republic of Korea.
Diagnostics (Basel, Switzerland)
|January 11, 2024
概括
这项研究比较了两个AI工具用于胸部X射线读数. 胸部X射线读取的卡卡奥大脑人工神经网络 (KARA-CXR) 显示了比ChatGPT更高的准确性和更少的错误,证明了AI.
科学领域:
- 医学成像和诊断 医学成像和诊断
- 医疗保健中的人工智能
- 放射学人工智能的人工智能
背景情况:
- 人工智能 (AI) 和大型语言模型 (LLM) 在医学诊断方面表现有前途.
- 评估人工智能工具,如KARA-CXR和ChatGPT用于胸部X射线解释,对于临床实用性至关重要.
研究的目的:
- 评估KARA-CXR和ChatGPT用于胸部X射线读数的诊断准确性和临床实用性.
- 为了比较专门的AI (KARA-CXR) 与医学成像中的一般LLM (ChatGPT) 的性能.
主要方法:
- 随机选择来自单一机构的2000张胸部X射线图像.
- 由两个独立的放射科医生对人工智能生成的读数进行评估,使用五个定性因素:准确性,错误发现,位置不准确性,计数不准确性和幻觉.
- 对诊断准确度和观察者之间的一致性进行统计分析.
主要成果:
- 与ChatGPT相比,KARA-CXR显示出明显更高的诊断准确度 (70.50%与40.50%) 和更少的错误发现 (68.00%与37.00%).
- 卡拉-CXR的位置不准确率和幻觉率明显低 (非幻觉率为75%),而不是聊天GPT (38%).
- 对两种AI系统在各种指标上都观察到适度的观察者间协议.
结论:
- 在胸部X射线解释方面,KARA-CXR表现出比ChatGPT更优越的诊断性能.
- 人工智能,特别是像KARA-CXR这样的专业模型,对于增强医学成像分析具有重大潜力.
- 建议进一步验证和整合人工智能工具,以提高放射学诊断效率和准确性.


