评估大型语言模型的性能,以支持对患有原发性免疫疾病的患者的诊断和管理
Nicholas L Rider1, Yingya Li2, Aaron T Chin3
1Department of Health Systems and Implementation Science, Virginia Tech Carilion School of Medicine, Roanoke, Va; Section of Allergy and Immunology, Department of Medicine, Carilion Clinic, Roanoke, Va.
The Journal of allergy and clinical immunology
|February 16, 2025
概括
生成型人工智能 (GAI) 在支持罕见疾病诊断方面表现有前途,顶级大型语言模型 (LLM) 实现了高精度. 在原发性免疫性疾病 (PI) 的最佳实践建议中需要进一步优化.
科学领域:
- 人工智能在医学中的应用
- 临床决策支持系统 临床决策支持系统
- 罕见疾病的诊断 罕见疾病的诊断
背景情况:
- 生成型人工智能 (GAI) 正在越来越多地影响医疗保健,但其对原发性免疫障碍 (PI) 等罕见疾病的实用性仍未得到充分研究.
- 本研究探讨了最先进的大型语言模型 (LLM) 在协助临床医生治疗PI方面的能力.
研究的目的:
- 量化和定性地评估开源LLMs对原发性免疫障碍 (PI) 的诊断准确性和临床决策支持实用性.
- 评估领先的LLM在罕见疾病管理的现实临床环境中的表现.
主要方法:
- 五位专家免疫学家通过多轮提示向6名LLM提交了5个匿名PI案例小组.
- 诊断准确性和临床推理质量使用修订IDEA (R-IDEA) 评分进行评估.
- 通过免疫学家叙述收集了定性反,以评估LLM的表现.
主要成果:
- 性能最好的LLM (GPT-4o,Llama-3.1-70B-Instruct,Mistral-Large-Instruct-2407) 显示出高的诊断准确性 (>88%) 和R-IDEA分数 (≥8).这些LLM的研究结果显示,他们有很高的诊断准确性 (>88%) 和R-IDEA分数 (≥8).
- GPT-4o实现了96.2%的最高诊断准确率.
- 三个LLM表现不佳 (精度<60%,R-IDEA得分低),在高性能和低性能之间发现了显著差异 (P <.001).
结论:
- 大型语言模型 (LLM) 可以帮助诊断和管理原发性免疫障碍 (PI).
- 需要进一步完善和调整LLM,以确保为罕见疾病护理提供最佳最佳实践建议.


