评估局部运行的大型语言模型,用于阻塞性睡眠呼吸暂停的诊断和治疗:现实世界的多睡眠学研究
Christopher Seifen1, Tilman Huppertz1, Katharina Bahr-Hamm1
1Sleep Medicine Center & Department of Otolaryngology, Head and Neck Surgery, University Medical Center Mainz, Mainz, Germany.
Nature and science of sleep
|July 15, 2025
概括
当地运行的大型语言模型 (LLM) 显示了睡眠医学的潜力,但需要显著改进来解释多睡眠学 (PSG) 结果. 虽然准确的治疗建议,在诊断睡眠呼吸暂停严重程度的LLM表现需要在临床使用之前改进.
科学领域:
- 人工智能在医学中的应用
- 睡眠科学 睡眠科学
- 医疗信息学 医疗信息学
背景情况:
- 睡眠医学是资源密集型,创造了对AI解决方案的需求.
- 当地运行的大型语言模型 (LLM) 解决了临床AI实施的数据保护问题.
- 本研究评估了第一次使用本地LLM来进行现实世界多睡眠学 (PSG) 解释.
研究的目的:
- 评估本地运行的LLM在解释PSG数据方面的表现.
- 将LLM的诊断和治疗建议与睡眠医生进行比较.
- 确定在临床睡眠医学中使用本地LLM的可行性.
主要方法:
- 选择了30名怀疑患有阻塞性睡眠呼吸暂停 (OSA) 的患者.
- 多睡眠学 (PSG) 结果由睡眠医生和三个当地LLM (Gemma2,Llama3,Mistral Nemo) 解释.
- 对诊断,OSA严重程度和治疗建议 (aPAP) 的一致性进行了测量.
主要成果:
- 对OSA严重程度的LLM一致性在33% (Gemma2) 到50% (Llama3) 之间.
- 米斯特拉尔·尼莫在自动正气道压力 (aPAP) 建议方面达到了90%的一致性.
- 杰玛2和拉玛3对aPAP建议显示了83%的一致性.
结论:
- 当地运营的LLM为睡眠医学应用提供了数据安全优势.
- 目前的LLM在解释PSG数据方面的表现,特别是用于诊断,需要大幅度改进.
- 在日常临床实施本地LLM用于PSG解释之前,需要进一步细化和微调.


