评估局部运行的大型语言模型 (Gemma 2,Mistral Nemo 和 Llama 3) 对于门诊耳鼻喉科护理:回顾性研究
Christoph Raphael Buhr1,2, Christopher Seifen1, Katharina Bahr-Hamm1
1Department of Otorhinolaryngology, University Medical Center of the Johannes Gutenberg-University Mainz, Langenbeckstraße 1, Mainz, 55131, Germany, +49 6131 17 7362.
JMIR formative research
|November 25, 2025
概括
当地运行的大型语言模型 (LLM) 显示出临床使用的潜力,但在诊断和治疗建议方面表现不如医生. 在改善数据隐私的同时,这些LLM需要进一步验证以确保安全的临床整合.
科学领域:
- 人工智能在医学中的应用
- 临床决策支持系统 临床决策支持系统
- 自然语言处理自然语言处理.
背景情况:
- 大型语言模型 (LLM) 为临床医生的效率提供了潜力,但对个性化患者数据提出了数据保护问题.
- 基于Web的LLM服务通常使用模拟案例,与现实世界的临床应用不同.
- 医疗器械标准的监管合规性是LLM在医疗保健中采用的关键挑战.
研究的目的:
- 评估本地运营的LLM (Gemma 2,Mistral Nemo,Llama 3) 在现实世界耳鼻喉科 (ORL) 门诊病例中进行诊断和治疗建议.
- 为了比较当地运行的LLM与人类临床医生的表现的表现.
- 评估LLM产生的建议的安全性和影响.
主要方法:
- 对30个ORL门诊病例的回顾性单中心研究.
- 匿名临床文档的LLM分析 (解剖记录,检查结果).
- 专家ORL顾问评级 (利克尔特尺度) 医学充分性,简洁性,连贯性,可理解性和患者安全风险;修改的图灵测试.
主要成果:
- 在所有评级类别中,ORL医生表现明显优于当地运营的LLM (P<.0005).
- 在32-54%的病例中,LLM建议构成患者安全风险,而医生则为1%.
- 通过LLM生成的信息对专家评价人的意见的影响很小 (1-4%).
结论:
- 当地运营的LLM显示出临床支持的希望,但与人类临床医生相比,目前的表现不佳,特别是在患者安全方面.
- 在解决数据隐私问题时,进一步的细化和潜在的验证对于LLM来说至关重要,以满足医疗器械法规.
- 当地运营的LLM的不断演变可能使它们成为支持临床实践的有价值工具.


