对生成人工智能模型在预测儿科紧急情况严重性指数水平方面的评估
Brandon Ho, Meng Lu1, Xuan Wang1
1Department of Computer Science, Virginia Tech, Falls Church, VA.
Pediatric emergency care
|January 6, 2025
概括
生成型人工智能 (AI) 模型在预测儿科紧急情况严重性指数 (ESI) 水平方面表现有前途. 微调人工智能显著提高了其用于儿科紧急选的准确性和可靠性.
科学领域:
- 医疗保健中的人工智能
- 儿科急救医学 儿科急救医学
- 临床选系统 临床选系统
背景情况:
- 准确和及时的患者评估在儿科急诊室至关重要.
- 紧急严重性指数 (ESI) 是一个广泛使用的分类工具.
- 评估生成人工智能 (AI) 对儿科患者ESI水平预测的潜力是一个新兴领域.
研究的目的:
- 评估多种生成性AI模型在预测儿科ESI水平方面的准确性和可靠性.
- 评估医疗导向微调对AI模型性能的影响.
- 为了比较各种人工智能模型的性能,包括ChatGPT-3.5,ChatGPT-4.0,T5,Llama-2,Mistral-Large和Claude-3 Opus.
主要方法:
- 使用了ESI手册v4中的70个儿科临床图片作为黄金标准.
- 为每个AI模型的ESI水平预测计算了性能指标 (灵敏度,特异性,F1得分).
- 评估可靠性使用重复测试和Fleiss kappa进行interrater协议,比较模型前后微调与配对t测试.
主要成果:
- 克劳德-3 Opus 在未经训练的模型中表现最高 (灵敏度: 80.6%,特异性: 91.3%,F1: 73.9%).
- 微调的GPT-4.0显示了显著的改善 (灵敏度:77.1%,特异性:92.5%,F1:74.6%,P<0.04).
- 对于克劳德-3 Opus (κ: 0.85),Mistral-Large (κ: 0.79) 和训练过的GPT-4.0 (κ: 0.67) 观察到高可靠性,而训练提高了GPT模型可靠性 (P < 0.001).
结论:
- 生成型人工智能模型在预测儿科ESI水平方面表现出显著的准确性.
- 医疗导向的微调大大提高了这些AI模型的性能和可靠性.
- 人工智能有可能成为改善儿科紧急诊断的有价值的辅助工具.


