专门的大型语言模型在盲目基于案例的评估中在复杂诊断中优于神经学家.
Sami Barrit1,2,3,4, Nathan Torcida4,5, Aurelien Mazeraud6,7
1Neurosurgery, Université Libre de Bruxelles, 1070 Brussels, Belgium.
Brain sciences
|May 1, 2025
概括
一个专门的人工智能 (AI) 大型语言模型 (LLM) 在复杂的神经诊断任务中显著超过神经科医生. 人工智能展示了卓越的准确性和速度,突出了其作为一种有价值的临床工具的潜力.
科学领域:
- 神经学 神经学
- 人工智能的人工智能
- 医学诊断 医学诊断 医学诊断
背景情况:
- 大型语言模型 (LLM) 显示了广泛的适用性,但在神经学等专业领域扎.
- 评估神经病学专业LLM的诊断能力和可信度至关重要.
- 这项研究将人工智能性能与模拟的神经诊断场景中的人类神经病学家进行比较.
研究的目的:
- 在复杂的神经病例中评估专门的LLM诊断性能.
- 将人工智能系统的准确性和效率与实践神经病学家进行比较.
- 评估人工智能生成的诊断信息的可信性和可验证性.
主要方法:
- GPT-4 Turbo LLM通过Neura AI基础设施部署,具有双数据库架构.
- 一个精心策划的神经学体被用于培训和评估.
- 13位神经学家和人工智能系统评估了5种临床情景,提供了差异和最终诊断.
主要成果:
- 人工智能获得的正常化得分 (86.17%) 比神经学家 (55.11%,p < 0.001) 高得多.
- 人工智能在差异诊断 (85%与46.15%) 和最终诊断 (88.24%与70.93%) 中都显示出更高的准确性.
- 人工智能在不到30秒的时间内响应,比神经病学家的平均9分钟快得多,所有参考资料都得到了验证.
结论:
- 该专业的LLM在复杂的神经挑战中表现出优越的诊断性能,与练习神经病学家相比.
- 当与精心策划的知识库集成时,LLM可以在复杂的临床学科中实现特定领域的相关性.
- 这表明AI作为临床神经学实践中高效准确的资产的潜力.


