聊天GPT 4.0可以诊断吗? 一项关于人工智能诊断能力的研究
Francesco Brigo1, Serena Broggi2, Eleonora Leuci3
1Innovation, Research and Teaching Service (SABES-ASDAA), Teaching Hospital of the Paracelsus Medical Private University (PMU), 39100 Bolzano, Italy.
Journal of clinical medicine
|January 25, 2025
概括
人工智能 (AI),特别是大型语言模型 (LLM),在诊断方面与人类专家达成的协议非常低. 虽然在排除方面更好,但人工智能工具在诊断中的临床用途需要显著改进.
科学领域:
- 神经学 神经学
- 医疗信息学 医疗信息学
- 人工智能的人工智能
背景情况:
- 的诊断依赖于专家对复杂临床数据的解释.
- 人工智能 (AI),特别是大型语言模型 (LLM),为增强诊断决策支持提供了潜力.
- 对人工智能的诊断能力与人类专业知识进行评估对于其安全实施至关重要.
研究的目的:
- 将ChatGPT 4.0的诊断协议与人类病学家进行诊断的比较.
- 评估AI在诊断中的性能指标 (灵敏度,特异性).
- 识别导致ChatGPT诊断错误的因素.
主要方法:
- 追溯分析了597名患者的病历,其中包括因而访问急诊室的病历.
- 通过使用2014年国际病联盟 (ILAE) 标准对病学家和ChatGPT 4.0的诊断进行比较.
- 统计分析包括科恩的卡帕,2x2应急表和多变量分析.
主要成果:
- 在36.2%的患者中,是由神经科医生诊断的,而ChatGPT诊断的患者比例为18.2%.
- 在人类和人工智能诊断之间观察到非常低的一致性 (科恩的卡帕 = -0.01).
- 对于的诊断,ChatGPT的灵敏度低 (17.6%),但特异性更高 (81.4%),老年患者更常见的错误.
结论:
- 在诊断时,ChatGPT 4.0的性能明显低于人类临床医生.
- 人工智能显示出识别非病例的能力高于病例.
- 需要进一步进行大量的研究,以提高LLM在管理中的诊断准确性和临床实用性.
更多相关视频
10:23Equipment Setup and Artifact Removal for Simultaneous Electroencephalogram and Functional Magnetic Resonance Imaging for Clinical Review in Epilepsy
Published on: June 23, 2023
1.8K
09:41A Pipeline for 3D Multimodality Image Integration and Computer-assisted Planning in Epilepsy Surgery
Published on: May 20, 2016
12.2K
