对实验室结果对大型语言模型影响的初步分析产生了差异诊断
Balu Bhasuran1, Qiao Jin2, Yuzhang Xie3
1School of Information, Florida State University, Tallahassee, FL, USA.
NPJ digital medicine
|March 19, 2025
概括
纳入实验室测试结果显著提高了大型语言模型 (LLM) 在生成差异诊断 (DDx) 的准确性. GPT-4表现出最高的性能,展示了LLM诊断支持的综合临床数据的价值.
科学领域:
- 医疗信息学 医疗信息学
- 医疗保健中的人工智能
- 临床决策支持系统 临床决策支持系统
背景情况:
- 差异诊断 (DDx) 是临床实践中的一个关键过程,用于区分具有重叠症状的疾病.
- 大型语言模型 (LLM) 越来越多地被探索,因为它们有助于医学诊断的潜力.
研究的目的:
- 评估实验室测试结果对各种LLM产生的差异诊断准确性的影响.
- 为了比较不同LLM在产生准确的差异诊断的性能,并没有临床实验室数据.
主要方法:
- 从PMC-Patients病例报告中整理了50个临床细节,包括患者的人口统计,症状和实验室数据.
- 五位LLM (GPT-4,GPT-3.5,Llama-2-70b,Claude-2,Mixtral-8x7B) 的任务是生成前10名,前5名和前1名的差异诊断.
- 对模型的性能进行了评估,并未将实验室测试结果纳入所提供的临床图片中.
主要成果:
- 实验室测试结果的整合在所有评估模型中提高了LLM驱动的DDx精度高达30%.
- GPT-4表现出最高的性能,达到最高1准确率为55% (95%CI:0.41-0.69) 和79%的温和准确率 (95%CI:0.68-0.90).
- 观察到统计学上显著的准确性改善 (霍尔姆调整后p < 0.05),特别是对于GPT-4和Mixtral-8x7B. 对于DDx,LLM通常会准确地解释常见的实验室测试 (例如,肝功能,代谢面板).
结论:
- 实验室数据在差异诊断任务中显著提高了大型语言模型的诊断准确性.
- GPT-4和Mixtral-8x7B表现出卓越的性能,突出了它们作为临床决策支持中宝贵工具的潜力.
- 在准确解释临床实验室结果方面,LLM显得有前途,有助于生成差异诊断.


