语言人工智能模型作为诊断医学的先驱? 对实时患者的回顾性分析
Azka Naeem1, Omair Khan2, Syed Mujtaba Baqir1
1Maimonides Medical Center, Brooklyn, NY 11219, USA.
Journal of clinical medicine
|February 26, 2025
概括
像GPT-4和GPT-3.5这样的大型语言模型显示的诊断准确度与急诊室医生相当. 这些人工智能工具显示出在实时医疗保健环境中增强临床决策的巨大潜力.
科学领域:
- 医疗信息学 医疗信息学
- 医疗保健中的人工智能
- 临床决策支持系统 临床决策支持系统
背景情况:
- 像GPT-3.5和GPT-4这样的大型语言模型 (LLM) 在帮助医疗保健专业人员解决临床问题方面表现有前途.
- 这些人工智能模型在实时临床场景中的性能,特别是在急诊室,需要进一步调查.
- 现有的研究还没有充分探索LLM与急诊医学中经验丰富的临床医生之间的比较准确性和可靠性.
研究的目的:
- 评估GPT-3.5和GPT-4在生成差异诊断方面的精度和可靠性,与董事会认证的急诊部 (ED) 护理人员相比.
- 评估人工智能模型在改善动态临床环境中的患者护理方面的潜力.
- 测试ED护理人员在ED差异诊断生成中表现出比GPT-3.5和GPT-4更高准确度的假设.
主要方法:
- 分析了2023年1月1日至2023年3月1日期间来自Maimonides医疗中心ED的实时患者数据.
- 将ChatGPT-3.5和GPT-4产生的差异诊断与主治医生提供的差异诊断进行比较,使用出院诊断作为黄金标准.
- 通过正确识别病例的比例和使用科恩的卡帕和类内相关系数的精度来评估准确性.
主要成果:
- 聊天GPT-4实现了最高的诊断准确度 (85.5%),紧随其后的是聊天GPT-3.5 (84.6%),以及ED出席 (83%).
- 在AI模型之间观察到适度的一致性 (科恩的kappa = 0.7),在ED参与者中达成的一致性较低.
- 分层分析显示,使用GPT-4的胃肠道投诉 (87.5%) 和使用GPT-3.5的心血管投诉 (81.34%) 的准确性更高.
结论:
- GPT-4和GPT-3.5的诊断准确度与董事会认证的急救服务员相当,表明它们作为决策支持工具的潜力.
- 人工智能聊天机器人对心血管疾病的可靠性和精度相似,这是ED中常见的高风险呈现.
- 这项研究支持将人工智能整合到医疗实践中,以提高临床决策的效率和有效性,这证明了对医疗保健中更广泛的人工智能应用的进一步研究.
相关概念视频
Language and Cognition
314
Language serves as a bridge between ideas and communication, influencing how individuals perceive and interact with the world. Psychologists have long debated whether language shapes thought or vice versa. This discussion gained grip with Edward Sapir and Benjamin Lee Whorf in the 1940s, who proposed that language determines thought, a concept known as linguistic determinism. They suggested that the vocabulary and structure of a language influence how its speakers think and perceive reality.
314
Improving Translational Accuracy
2.5K
2.5K


