人工智能模型用于预测紧急部门的分类:对自然语言处理,大语言模型和联合嵌入预测架构的七个月后期比较研究
Edouard Lansiaux1, Ramy Azzouz2,3, Emmanuel Chazard3,4
1Emergency Department, Lille University Hospital, Lille, France.
JMIR medical informatics
|March 10, 2026
概括
一个大型语言模型 (LLM) 在预测急诊室 (ED) 选结果方面显示出最高的准确性,优于其他人工智能模型和护士选. 然而,显著的过和偏差限制了其目前的临床使用,需要进一步验证和安全评估.
科学领域:
- 紧急医疗 紧急医疗
- 人工智能的人工智能
- 临床信息学 临床信息学
背景情况:
- 紧急部门 (ED) 的分离错误会危及患者安全和资源分配.
- 越来越多的患者数量和员工挑战凸显了在分选方案中需要人工智能的需求.
研究的目的:
- 开发和比较三个人工智能模型 (NLP,LLM,JEPA) 以预测法国急诊护士在医院的分类 (法语) 的分类结果.
- 评估人工智能模型的性能与护士分拣和临床专家共识相比.
主要方法:
- 追溯分析了73,236次成人ED访问 (2024年6月至12月),包括完整的音频/结构化数据.
- 开发了TRIAGEMASTER (NLP),URGENTIAPARSE (LLM) 和EMERGINET (JEPA) 模型. 这三种模型都在使用.
- 使用加权的 κ,斯皮尔曼相关性,F1分数,AUC-ROC,MAE和RMSE评估与金标准的法语分类的一致性.
主要成果:
- 与EMERGINET (0.438),TRIAGEMASTER (-3.511) 和护士分拣 (-4.343) 相比,URGENTIAPARSE (LLM) 显示出更优异的性能 (复合z=2.514),并且与其相比.
- URGENTIAPARSE实现了高精度 (F1=0.900,AUC=0.879, κ=0.800),但表现出过度拟合 (训练=1.0,验证≈0.5).
- 位师和护士位表现不佳 (F1=0.618,0.303).
结论:
- 基于LLM的URGENTIAPARSE在ED分选预测方面显示出最高的准确性,但由于过度拟合和选择偏差,其临床适用性有限.
- 在部署人工智能分类系统之前,严格的验证,偏差缓解和安全评估至关重要.
- 人工智能分类支持系统看起来很有前途,但需要仔细实施,以确保患者的安全性和可靠性.
更多相关视频
09:52Setting Up a Stroke Team Algorithm and Conducting Simulation-based Training in the Emergency Department - A Practical Guide
Published on: January 15, 2017
18.0K
04:09Predicting Treatment Response to Image-Guided Therapies Using Machine Learning: An Example for Trans-Arterial Treatment of Hepatocellular Carcinoma
Published on: October 10, 2018
8.9K
