在诊断临床微生物学实验室面向的病例场景中ChatGPT的表现
Malik Sallam1,2, Khaled Al-Salahat1, Eyad Al-Ajlouni1
1Department of Pathology, Microbiology and Forensic Medicine, The University of Jordan, School of Medicine, Amman, JOR.
Cureus
|December 18, 2023
概括
在诊断临床微生物学场景中,ChatGPT-4在诊断临床微生物学场景中表现优于ChatGPT-3.5,尽管这两种模型都显示出可变性和不相关内容的倾向. 对于临床应用,还需要进一步改进.
科学领域:
- 医疗信息学 医疗信息学
- 医疗保健中的人工智能
- 临床微生物学 临床微生物学
背景情况:
- 人工智能 (AI) 工具,包括ChatGPT,正在越来越多地影响医疗保健.
- 在医疗保健任务中评估不同版本的ChatGPT的可靠性和可信性至关重要.
- 本研究的重点是评估ChatGPT在诊断临床微生物学中的性能.
研究的目的:
- 评估和比较ChatGPT-3.5和ChatGPT-4在诊断临床微生物学病例场景中的性能.
- 评估这些AI模型在专业医疗领域的可靠性和可信度.
主要方法:
- 这项研究遵循了METRICS检查清单,用于AI研究设计和报告.
- 在十个不同的诊断临床微生物学案例中测试了ChatGPT-3.5和ChatGPT-4.
- 两位独立评级人员使用CLEAR工具 (完整性,缺乏虚假信息,证据支持,适当性,相关性) 评估绩效,评级人员之间的一致性由科恩的 κ统计学评估.
主要成果:
- 一般来说,ChatGPT-4的表现优于ChatGPT-3.5,平均CLEAR分数为3.21±1.05与2.64±1.06 (P=.012) 相比.
- 这两种模型在"相关性"方面表现最低,并且在抗菌素敏感性测试 (AST) 查询中遇到了困难.
- 在细菌和真菌鉴定中观察到最高的性能,ChatGPT-4在"完整性"",缺乏虚假信息"和"证据支持"方面显示了统计学上显著的改善.
结论:
- 在诊断临床微生物学案例中,ChatGPT-4比ChatGPT-3.5更有效.
- 性能因主题而异,在两种模式中都有明显的无关内容生成趋势.
- 虽然目前的ChatGPT模型显示出潜力,但在微生物学诊断中可靠的临床使用需要大幅度改进.


