在检测IV液体污染方面,GPT-4表现低于专家
Nicholas C Spies1, Zita Hubler1, Stephen M Roper1,2
1Department of Pathology and Immunology, Washington University in St. Louis School of Medicine, St. Louis, MO, United States.
The journal of applied laboratory medicine
|September 13, 2023
概括
像GPT-4这样的大型语言模型在检测实验室样本中静脉注射 (IV) 液体污染时不如医疗保健人员那么准确. 对于可靠的IV液体污染检测,仍需要自动化工具.
科学领域:
- 临床实验室科学 临床实验室科学
- 医疗保健中的人工智能
- 诊断的准确性 诊断的准确性
背景情况:
- 临床实验室样本中的静脉注射 (IV) 液体污染是一个常见的问题.
- 目前的检测方法,如角检查和手动审查,往往不敏感,并破坏实验室的工作流程.
- 需要更有效和自动化的方法来识别IV液体污染.
研究的目的:
- 评估大型语言模型 (LLM) 在实验室样本中检测IV晶化物污染的有效性.
- 为了比较LLM (GPT-4) 与训练有素的医疗保健人员 (HCP) 在识别受污染的样本方面的表现.
主要方法:
- 模拟的基本代谢面板的污染使用正常盐水 (NS) 和5%的乳糖在正常盐水 (D5NS) 在不同的混合比率.
- 一个多模式的LLM (GPT-4) 和一个由8名HCP组成的小组的任务是区分真实和受污染的结果.
- 性能指标包括分类准确性,混合物定量和置信度等,使用统计分析进行了比较.
主要成果:
- 医疗人员在检测IV液体污染时,表现出比GPT-4 (95%CI:NS为0.57-0.71,D5NS为0.57-0.57) 更高的准确性 (95%CI:0.73-0.80).
- 医疗保健专家倾向于高估较低的混合物比率中的污染严重程度,而GPT-4显著高估了D5NS混合物的污染程度.
- 没有发现GPT-4或HCP报告的信任水平与其分类的准确性之间的相关性.
结论:
- 大型语言模型,特别是GPT-4,目前在基本代谢面板中检测IV液体污染的准确性低于训练有素的医疗人员.
- 即使是受过训练的个体的不完美表现也凸显了对在临床实验室中可靠检测污染的新型自动化解决方案的持续需求.


