在住院神经病学中ChatGPT4的诊断准确性:一个回顾性队列研究
Sebastian Cano-Besquet1, Tyler Rice-Canetto1, Hadi Abou-El-Hassan2
1California University of Science and Medicine, 1501 Violet St, Colton, Ca, 92324, USA.
Heliyon
|January 6, 2025
概括
像ChatGPT-4 (CG4) 这样的大型语言模型显示了与住院病人的神经病学家相比较的诊断准确性. 将CG4与顾问诊断相结合,可以提高综合诊断率,帮助患者护理.
科学领域:
- 医疗信息学 医疗信息学
- 人工智能在医学中的应用
- 临床神经学 临床神经学
背景情况:
- 大型语言模型 (LLM) 证明了医疗保健在行政任务和决策支持方面的潜力.
- 与其他LLM相比,ChatGPT-4 (CG4) 在诊断准确性测试中表现优越.
- 这项研究探讨了CG4在一个专门的临床领域的诊断能力:住院神经病学.
研究的目的:
- 为了评估ChatGPT-4 (CG4) 在住院神经病学咨询服务中的诊断准确性.
- 将CG4的诊断性能与咨询神经病学家的诊断性能进行比较.
- 评估CG4诊断输出的全面性和准确性.
主要方法:
- 在Arrowhead区域医疗中心对51次住院神经病学咨询进行了审查.
- 患者数据被输入到CG4 (使用符合HIPAA的方法) 以生成差异诊断,调查和治疗计划.
- 一个全面度量 (0-3) 评价了CG4诊断的准确性与咨询神经病学家的最终诊断的准确性,这些诊断被认为是准确的.
主要成果:
- CG4的诊断准确度与咨询神经科医生相当,全面诊断的成功率很高 (CG4的96.1%,咨询师的94.1%).
- 咨询神经科医生显示,提供更全面的诊断的可能性略高 (p=0.02).
- 将CG4的诊断与顾问诊断相结合,在所有病例中都实现了全面诊断 (NNT=17对一个额外的全面诊断).
结论:
- 聊天GPT-4 (CG4) 是在住院神经病学中初步诊断的一个有价值的工具,其性能与咨询神经病学家相当.
- CG4可以增强诊断过程,潜在地减少错过诊断和改善患者的治疗结果.
- 建议对更大样本进行进一步的研究,以验证这些发现并评估LLM对患者健康的影响.


