人工智能可以通过为神经外科医生生成差异诊断来缓解错过的诊断吗?
Rohit Prem Kumar1, Vijay Sivan1, Hanin Bachir1
1Department of Neurosurgery, Hackensack Meridian School of Medicine, Nutley, New Jersey, USA.
World neurosurgery
|May 17, 2024
概括
大型语言模型 (LLM) 在改善神经外科差异诊断方面表现有前途. 虽然准确性各不相同,但LLM可以帮助识别等疾病,从而减少诊断延迟.
科学领域:
- 医疗信息学 医疗信息学
- 人工智能在医学中的应用
- 神经外科 神经外科
背景情况:
- 精确的差异诊断在神经外科手术中至关重要.
- 神经外科手术的诊断延迟导致了重大的健康和经济挑战.
- 大型语言模型 (LLM) 正在成为医疗保健中的潜在工具.
研究的目的:
- 评估LLM在协助神经外科医生进行差异诊断方面的作用.
- 在神经外科病例中评估各种LLM的诊断准确性.
主要方法:
- 使用了三个基于聊天的LLM:ChatGPT (3.5和4.0),困惑AI和BardAI.
- 提示的LLM与20个神经外科疾病的临床细节.
- 根据在顶部差异内正确识别目标疾病来确定LLM准确度.
主要成果:
- 聊天GPT 3.5 和 4.0 的初始准确率分别为52.63%和53.68%.
- 困惑的人工智能和Bard的人工智能实现了40.00%和29.47%的准确性.
- 聊天GPT 3.5 在前5个差异中达到77.89%的准确性;Bard AI在前5个差异中改进到62.11%
- 在等常见疾病方面,LLM的表现很好,但在复杂疾病 (如莫亚莫亚病) 中表现不佳.
结论:
- 在神经外科手术中,LLM具有提高诊断准确性的潜力.
- 这些人工智能工具可能有助于减少错过诊断的发生率.


