大型语言模型 (LLM) 的诊断性能与睡眠医学医生的诊断性能相比
Anshum Patel1, Chad Ruoff2, Scott A Helgeson3
1Division of Pulmonary, Allergy and Sleep Medicine, Mayo Clinic, Jacksonville, FL, USA.
Sleep medicine
|July 20, 2025
概括
大型语言模型 (LLM) 在临床场景中表现出与睡眠医生可比的诊断准确性. 这些人工智能工具显示出作为医学诊断的宝贵补充资源的潜力.
科学领域:
- 医疗人工智能 医疗人工智能
- 临床诊断 临床诊断 临床诊断
- 睡眠医学研究 睡眠医学研究
背景情况:
- 人工智能 (AI),特别是大型语言模型 (LLM),正在被探索用于医学诊断应用.
- 当LLM集成到临床系统中时,可能会增强临床医生的诊断推理.
- 在睡眠医学中LLM的诊断性能尚未与专家医生进行评估.
研究的目的:
- 为了比较三个著名的LLM与经验丰富的睡眠医生之间的诊断准确性.
- 这项研究使用了现实世界的临床病例视频进行评估.
主要方法:
- 从AASM案例书 (2019) 中使用了16个不同的睡眠障碍片段.
- 三位LLM (ChatGPT-4,Gemini 2.0,DeepSeek) 和三位经过董事会认证的睡眠医生独立评估了这些图片.
- 差异性诊断与AASM参考清单进行了比较,最终诊断使用3分利克特等级得分.
主要成果:
- 在差异诊断方面,LLM的平均同意率与医生 (72.9%) 的平均同意率相似 (70.7%-77.7%).
- 在LLM和医生之间的差异诊断准确性方面没有发现统计学上显著的差异 (p=0.839).
- 在专家医生 (81.3%-96.9%) 范围内,LLM的平均最终诊断一致性得分为87.5%.
结论:
- 经验丰富的睡眠临床医生的诊断性能与经验丰富的睡眠临床医生相美.
- 在医学诊断方面,LLM显示出作为辅助工具的潜力.
- 建议进行进一步的研究,以探索LLMs在临床实践中的更广泛应用和整合.
关键词:
人工智能的人工智能是人工智能.聊天GPT-4 聊天GPT-4 聊天临床决策支持 (CDS) 临床决策支持在DeepSeek搜索中深入搜索.双子座是一个双子座.大型语言模型.睡眠的药物 睡眠的药物更多相关视频
04:54Author Spotlight: IntelliSleepScorer — A High-Accuracy, Accessible GUI Software for Automated Sleep Stage Scoring in Mice and its Application in Psychiatric Research
Published on: November 8, 2024
659
04:33Author Spotlight: Unveiling the Connection Between Sleep Disorders and Cognitive Symptoms in Depression
Published on: April 26, 2024
810
