从病例报告中对ChatGPT-3.5用于多发性硬化症的诊断准确性的试点评估
Anika Joseph1, Kevin Joseph2, Angelyn Joseph3
1Health Sciences Program, University of Ottawa, 75 Laurier Ave E, Ottawa, ON K1N 6N5, Canada.
Translational neuroscience
|December 27, 2024
概括
人工智能 (AI) 模型在疾病诊断方面显示出潜力,但存在局限性. 聊天GPT-3.5在多发性硬化症诊断中实现了78.6%的准确性,表明需要在临床实践中进行严格的验证.
科学领域:
- 医疗信息学 医疗信息学
- 医疗保健中的人工智能
- 临床诊断 临床诊断 临床诊断
背景情况:
- 在疾病诊断中,有关人工智能 (AI) 的患者安全问题尚未得到充分研究.
- 潜在的挑战包括诊断错误和人工智能驱动的医学评估的法律影响.
研究的目的:
- 为了证明AI大型语言模型的诊断局限性.
- 从基于文本的病例报告中评估ChatGPT-3.5在诊断多发性硬化症 (MS) 中的准确性.
主要方法:
- 对98份经过同行评审的多发性硬化症病例报告 (2014-2024) 的分析,不包括诊断的明确提及.
- 使用ChatGPT-3.5解释临床表现和实验室数据以评估诊断能力.
主要成果:
- 在98例病例中,ChatGPT-3.5在77例病例中正确诊断了多发性硬化症,达到78.6%的准确率.
- 21例病例被误诊,突出了AI的局限性,因为数据的变化和诊断的复杂性.
结论:
- 人工智能在支持临床决策方面表现有前途,但需要广泛的验证.
- 不充分的AI培训数据可能导致严重的诊断不准确性,需要强大的监管框架来安全整合.


