定制大型语言模型对罕见儿科疾病病例报告的诊断准确性
Cameron C Young1,2, Ellie Enichen1,2, Christian Rivera1,2
1Harvard Medical School, Boston, Massachusetts, USA.
American journal of medical genetics. Part A
|September 13, 2024
概括
这项研究评估了用于诊断罕见儿科疾病的大型语言模型 (LLM). 虽然GPT-4显示出更高的准确性,但GPT-4 HPO在差异诊断和疾病分类方面表现更好,突出了LLMs.
科学领域:
- 医疗信息学 医疗信息学
- 人工智能在医学中的应用
- 儿科诊断 儿科诊断 儿科诊断
背景情况:
- 由于其复杂的表现,诊断罕见儿科疾病存在重大临床挑战.
- 大型语言模型 (LLM) 是新兴的工具,在医学诊断中具有潜在的应用.
研究的目的:
- 评估和比较三个LLM的诊断性能:GPT-4,Gemini Pro和一个与人体类型本体学 (GPT-4 HPO) 集成的定制GPT-4模型.
- 评估LLM在识别特定诊断,生成差异诊断和将疾病分类在儿科罕见病病例中的能力.
主要方法:
- 用61份罕见儿科疾病病例报告来评估LLM诊断绩效.
- 在100份一般儿科病例报告中,GPT-4 HPO进一步得到了验证.
- 绩效指标包括诊断准确性,在差异清单中的正确诊断,以及广泛的疾病类别识别.
主要成果:
- GPT-4的诊断准确率达到13.1%,而GPT-4 HPO和Gemini Pro的诊断准确率达到8.2%.
- 在差异清单和广泛的疾病类别中,GPT-4 HPO在确定正确诊断方面表现优于GPT-4和Gemini Pro.
- 定制的GPT-4 HPO模型显示了更好的诊断支持功能,当增强与特定领域的本体学.
结论:
- 在支持罕见儿科疾病诊断方面,LLM显得有前途,特别是当它与专业知识库 (如本体学) 相结合时.
- 目前的LLM绩效需要在诊断决策的临床整合之前进一步提高.
- 对特定领域的改进对于提高复杂的医学诊断任务中的LLM准确性至关重要.


