基于文字与视觉信息的ChatGPT的诊断性能与放射科医生在肌肉骨放射学中的诊断性能相比
Daisuke Horiuchi1, Hiroyuki Tatekawa1, Tatsushi Oura1
1Department of Diagnostic and Interventional Radiology, Graduate School of Medicine, Osaka Metropolitan University, Osaka, Japan.
European radiology
|July 12, 2024
概括
基于生成预训练变压器 (GPT) -4的ChatGPT显示出诊断准确度与肌肉骨放射科的放射科住院医生相美,表现优于GPT-4V,但不是经过董事会认证的放射科医生.
科学领域:
- 医疗诊断中的人工智能
- 肌肉骨放射学 肌肉骨放射学
- 大型语言模型.
背景情况:
- 基于生成预训练变压器 (GPT) -4的ChatGPT和具有视觉的GPT-4 (GPT-4V) 是先进的AI模型,在医学诊断中具有潜在的应用.
- 在像肌肉骨放射学这样的专业领域评估这些AI模型的诊断准确性对于理解它们的临床实用性至关重要.
研究的目的:
- 为了比较基于GPT-4的ChatGPT,基于GPT-4V的ChatGPT和肌肉骨放射学中的人类放射科医生的诊断准确度.
- 评估人工智能模型的性能与不同级别的人类专业知识相比.
主要方法:
- 从骨放射学中使用了106个"测试自己"病例.
- 基于GPT-4的ChatGPT接收了病史和成像发现;基于GPT-4V的ChatGPT接收了病史和图像.
- 从两种AI模型的诊断与地面真相和独立评估的诊断进行了比较,这些诊断来自放射科医生和董事会认证的放射科医生.
主要成果:
- 基于GPT-4的ChatGPT实现了43%的准确性,显著超过基于GPT-4V的ChatGPT (8%) (p < 0.001).
- 一名放射科医生获得了41%的准确率,而经过董事会认证的放射科医生获得了53%的准确率.
- 基于GPT-4的ChatGPT的准确性与住院医生相似 (p = 0.78),但低于董事会认证的放射科医生 (p = 0.22).
结论:
- 与基于GPT-4V的ChatGPT相比,基于GPT-4的ChatGPT在肌肉骨放射学中显示出更高的诊断性能.
- 虽然可以与放射科住院医生进行比较,但基于GPT-4的ChatGPT无法达到董事会认证放射科医生的诊断准确度.
- 为了实现最佳利用,放射科医生应该将成像发现的详细描述输入到ChatGPT,而不是图像本身.
更多相关视频
07:15Machine Learning Algorithms for Early Detection of Bone Metastases in an Experimental Rat Model
Published on: August 16, 2020
6.8K
07:44Evaluation of Patients' Posture and Gait Profile After Lumbar Fusion Surgery by Video Rasterstereography and Treadmill Gait Analysis
Published on: March 23, 2019
17.7K
