评估大型语言模型作为复杂医疗病例的诊断辅助
Alejandro Ríos-Hoyo1, Naing Lin Shan1, Anran Li2
1Yale Cancer Center, Yale School of Medicine, New Haven, CT, United States.
Frontiers in medicine
|July 5, 2024
概括
大型语言模型 (LLM) 在生成差异诊断方面表现有前途,GPT-4的表现优于GPT-3.5.5. 然而,LLM目前是临床判断的辅助,而不是替代.
科学领域:
- 医疗信息学 医疗信息学
- 人工智能在医学中的应用
背景情况:
- 大型语言模型 (LLM) 在医疗保健中越来越多地用于像回答医疗问题的任务.
- 评估LLM的诊断能力对于其安全有效的实施至关重要.
研究的目的:
- 评估OpenAI的GPT-3.5和GPT-4在生成复杂临床病例的准确差异诊断方面的性能和局限性.
主要方法:
- 分析了来自马萨诸塞州总医院记录的75个临床病例.
- 使用GPT-3.5和GPT-4模型生成了差异诊断.
- 通过LLM生成的诊断与专家诊断进行了比较,使用了诸如前三类纳入率和Jaccard相似度等指标.
主要成果:
- 与GPT-3.5相比,GPT-4产生了更全面的差异诊断,与专家名单相似度更高.
- 在大约三分之二的病例中,GPT-4包括了正确的诊断,但往往不是主要建议.
- 在LLM输出中诊断的存在与其文学流行率相关,而不是疾病发病率.
结论:
- 像GPT-4这样的LLM可以通过扩大诊断考虑来帮助临床医生,但尚未用于初级诊断.
- 未来的LLM需要培训,以更好地将疾病发病率与文献代表性保持一致,以提高诊断准确性.


