人类智能与聊天GPT对比:谁在选患者的正确分类方面表现更好?
Arian Zaboli1, Francesco Brigo1, Serena Sibilio2
1Innovation, Research and Teaching Service (SABES-ASDAA), Teaching Hospital of the Paracelsus Medical Private University (PMU), Bolzano, Italy.
The American journal of emergency medicine
|February 11, 2024
概括
与 triage 护士相比,聊天GPT 在急诊室患者风险分层中显示出低可靠性. 人工智能需要进一步开发,以便在医疗保健环境中安全有效地使用.
科学领域:
- 医疗信息学 医疗信息学
- 人工智能在医学中的应用
- 紧急医疗 紧急医疗
背景情况:
- 像Chat-GPT这样的人工智能 (AI) 工具在医学中显示出潜力.
- 人工智能可能有助于在急诊室 (ED) 选期间对患者的风险分层.
研究的目的:
- 为了比较聊天-GPT的准确性与人类分拣护士在分层的急诊室患者.
- 评估AI在预测患者死亡率和住院等结果方面的表现.
主要方法:
- 使用了30个真实临床病例简介的样本.
- 使用科恩的卡帕测量了对应度.
- 通过接受器操作特征 (AUROC) 曲线下的面积来评估性能,包括72小时死亡率.
主要成果:
- 与选护士的聊天-GPT一致性很低 (科恩的卡帕=0.278).
- 在所有结果中,分组护士表现出更高的AUROC值.
- 三级护士在预测72小时死亡率方面明显优于聊天-GPT (AUROC 0.910与0.669).
结论:
- 目前的聊天-GPT可靠性不足以取代在ED患者优先排序中的 triage 护士.
- 为了提高临床风险分层的安全性和有效性,需要进一步开发人工智能.


