在急诊室诊断中对ChatGPT模型代进行初步评估
Jinge Wang1, Kenneth Shue1, Li Liu2,3
1Department of Microbiology, Immunology & Cell Biology, West Virginia University, Morgantown, WV, 26506, USA.
Scientific reports
|March 27, 2025
概括
新的ChatGPT模型显示,与旧版本相比,急诊室患者的诊断准确度有所提高. 明确提示推理提高了表现,尽管非典型的情况仍然是一个挑战.
科学领域:
- 人工智能在医学中的应用
- 临床决策支持系统 临床决策支持系统
- 在医疗保健中的自然语言处理.
背景情况:
- 像ChatGPT这样的大型语言模型 (LLM) 提供了在急诊室 (ED) 协助医疗保健专业人员的潜力.
- 最新的ChatGPT模型在现实世界临床环境中的诊断准确性,特别是EDs,需要进行彻底的评估.
研究的目的:
- 评估各种ChatGPT模型 (GPT-3.5,GPT-4,GPT-4o和o1系列) 对急诊室 (ED) 患者病例的诊断性能.
- 调查调用明确推理 ("思想") 对这些LLM聊天机器人的诊断准确性的影响.
主要方法:
- 一项回顾性研究评估了30例急诊病例的多个ChatGPT模型的诊断预测.
- 模型之间的性能进行了比较,并评估了有或没有明确的推理提示.
主要成果:
- 像GPT-4o和o1系列这样的新型号在识别主要诊断方面取得了比GPT-3.5 (47.8%) 更高的准确性 (60%).
- 调用推理显著改善了GPT-4o模型的领先诊断预测 (例如,4o-2024-0513:45.6%至56.7%).
- 所有模型都在与非典型的表现作斗争,例如没有发烧的肺炎,突出限制.
结论:
- 与早期版本相比,先进的ChatGPT模型显示了ED患者的增强诊断能力.
- 对于较新的模型来说,明确的推理提示是有益的,但当前的LLM面临着复杂和非典型的临床表现的局限性.


