评估大型语言模型,用于诊断口腔炎综合征
Takayuki Suga1, Osamu Uehara2, Yoshihiro Abiko3
1Department of Psychosomatic Dentistry, Graduate School of Medical and Dental Sciences, Institute of Science Tokyo, Tokyo, Japan.
Journal of pain research
|March 24, 2025
概括
大型语言模型显示出诊断燃烧口腔综合征的前景,ChatGPT和Claude达到99%的准确性. 由于模型变化和诊断中的潜在错误,临床医生监督仍然至关重要.
科学领域:
- 人工智能在牙科中的应用
- 医学诊断 医学诊断 医学诊断
- 口腔医学是指口腔医学.
背景情况:
- 燃烧口腔综合征存在诊断挑战,因为它的主观性质和缺乏明确的病因.
- 大型语言模型 (LLM) 正在成为各种专业医学诊断的潜在工具.
研究的目的:
- 评估领先的LLMs在识别燃烧口腔综合征的诊断准确度.
- 探索LLM诊断推理对这种情况的潜在局限性和变异.
主要方法:
- 100个口腔炎综合征病例的综合临床细节被三个LLM评估:ChatGPT-4o,双子座高级1.5 Pro和克劳德3.5索内特.
- 要求LLM进行初级诊断,差异诊断和推理,准确性与专家评估相比较.
主要成果:
- 聊天GPT和克劳德展示了99%的准确性,显著优于双子 Advanced (89%的准确性,p < 0.001).
- 观察到的错误诊断包括持久性异常性面部疼痛和其他疾病,模型之间的推理模式和数据请求有显著差异.
结论:
- LLM显示出作为燃烧口腔综合征的补充诊断辅助的巨大潜力,特别是在资源有限的环境中.
- 由于观察到模型性能和推理的变化,临床人员的监督和专家验证至关重要,以确保准确的患者管理.


