在大型语言模型,聊天GPT和急诊医学的未受过培训的医生中测试性能:比较研究
Lars Masanneck1,2, Linea Schmidt2, Antonia Seifert3
1Department of Neurology, Medical Faculty and University Hospital Düsseldorf, Heinrich Heine University Düsseldorf, Düsseldorf, Germany.
Journal of medical Internet research
|June 14, 2024
概括
大型语言模型 (LLMs) 和ChatGPT显示了与未经培训的急诊室 (ED) 医生相比的分拣能力,但尚未成为专业人员. 在这项研究中,LLM并没有显著提高未经培训的员工分拣技能.
科学领域:
- 人工智能在医学中的应用
- 临床决策支持系统 临床决策支持系统
- 医疗保健信息学 医疗保健信息学
背景情况:
- 大型语言模型 (LLM) 在医疗应用中表现有前途,包括急诊室 (ED) 选.
- 本研究评估了LLM和ChatGPT与人类分拣性能以及它们在协助未经培训的人员方面的潜力.
- 对ED设置的高需求需要探索高效和准确的分拣方法.
研究的目的:
- 评估各种LLM和ChatGPT与不同培训水平的ED工作人员相比的分拣效果.
- 确定LLM输出是否可以提高未经培训的人员的分拣能力.
- 为了对LLM的表现进行比较,将其与已建立的分拣系统比较,例如曼彻斯特分拣系统 (MTS).
主要方法:
- 124个匿名的ED病例简报被未经培训的医生,LLM (GPT-4,Llama 3 70B,Gemini 1.5,Mixtral 8x7b),ChatGPT和专业评级人员进行了分类.
- 分离级别是根据曼彻斯特分离系统 (MTS) 分配的.
- 使用二次加权的Cohen κ来测量一致性,并分析过量和不足;ChatGPT使用零射击提示.
主要成果:
- 基于GPT-4的ChatGPT和未经培训的医生与专业共识达成了实质性的协议 (κ≈0.67-0.68),超过了基于GPT-3.5的ChatGPT (κ≈0.54).
- 使用LLM作为第二意见略有改善了未经培训的医生的分拣,但没有统计学意义 (κ≈0.70).
- 经过测试的LLM表现不同,有些人表现出不寻常的行为;模型倾向于过度选,而未经培训的医生选不足.
结论:
- 目前的LLM和ChatGPT与经过专业培训的ED评级者不匹配,但与未受过培训的医生的表现相等.
- 在这项研究中,LLM和ChatGPT并没有显著提高未经培训的员工作为决策支持的分拣能力.
- 较新的LLM版本的进步表明,通过进一步开发和针对ED分类的专门培训,可以提高性能.


