大型语言模型的评估作为紧急部门重新访问预测者
Emma Chen1, Luyang Luo2, Fatma Gunturkun3
1Department of Biomedical Informatics, Harvard Medical School, Boston, MA, USA2Harvard John A. Paulson School Of Engineering And Applied Sciences, Cambridge, MA, USA, yingchen@g.harvard.edu.
Pacific Symposium on Biocomputing. Pacific Symposium on Biocomputing
|February 27, 2026
概括
大型语言模型 (LLM) 在临床预测方面显示出潜力,但在现实世界急诊室 (ED) 重复检查任务方面存在困难. 目前的LLM,即使使用先进的方法,也无法超过传统模型,这凸显了临床预测的局限性.
科学领域:
- 人工智能在医学中的应用
- 临床信息学 临床信息学
- 机器学习用于医疗保健
背景情况:
- 大型语言模型 (LLM) 展示了临床推理和问题答案的能力.
- 在现实世界的临床预测任务中,LLM的有效性,例如预测患者的结果,仍然在很大程度上未经研究.
- 预测急诊室 (ED) 再访对于优化患者护理和资源配置至关重要.
研究的目的:
- 评估大型语言模型 (LLM) 在预测30天急诊室 (ED) 再访的性能.
- 为了比较不同的LLM建模范式,包括直接预测和基于嵌入的方法.
- 用全面的临床数据对传统机器学习模型进行LLM绩效的比较.
主要方法:
- 一项大规模的研究涉及138010名来自斯坦福大学的成年ED访客.
- 评估了两个LLM方法:使用自然语言输出的直接预测和基于嵌入的方法 (LLM2Vec).
- 检索增强被应用于直接预测;LLM衍生嵌入被用于下游建模.
主要成果:
- 基于嵌入的LLM方法 (LLM2Vec F1=0.4505) 超过了直接预测方法 (第3.7条 F1=0.4160与检索增强).
- 尽管获得了大量数据,但所有LLM方法 (F1=0.3022-0.4505) 的表现都低于仅使用结构化数据的传统LightGBM模型 (F1=0.4614).
- 对17,488个预测的分析表明,LLM推理失败包括过重历史,忽视保护因素和风险厌恶.
结论:
- 当前一代的LLM在ED复发预测等临床预测任务中表现出根本的局限性.
- 基于嵌入的LLM方法显示出希望,但尚未超越传统模式.
- 需要进一步的研究来解决临床应用的LLM系统推理失败的问题.


