皮肤病诊断中的大型语言模型的比较分析:对诊断准确性的评估
Niharika Tekchandani1, Anurup Mukherjee2, Nandakumar Poonthottam1
1Medicine, Medway NHS Foundation Trust, Kent, GBR.
Cureus
|September 15, 2025
概括
聊天GPT-4o和克劳德3.7索内特在诊断罕见的皮肤疾病方面表现有前途,表现优于双子座2.0闪光灯. 这些人工智能工具可以帮助临床医生,但不应该取代专家的判断.
科学领域:
- 医学中的人工智能.
- 皮肤病学和诊断工具.
背景情况:
- 皮肤病学严重依赖于视觉模式识别进行诊断.
- 大型语言模型 (LLM) 在具有挑战性的情况下提供了增强诊断推理的潜力.
- 这项研究评估了LLM的诊断能力,使用罕见的皮肤病例报告.
研究的目的:
- 评估和比较三个领先的LLM的诊断性能 (ChatGPT-4o,克劳德3.7索内特,双子座2.0闪光灯).
- 评估LLM诊断罕见皮肤病的能力,仅基于临床表现.
主要方法:
- 15个罕见的皮肤病例报告的回顾性分析.
- 临床特征通过标准化提示符输入到LLM中.
- 评估了LLM输出 (顶部诊断和差异) 的准确性和正确诊断的包含.
主要成果:
- 聊天GPT-4o和克劳德3.7实现了66.7%的最高匹配精度,超过双子座2.0 (53.3%).
- 差异性诊断覆盖率为ChatGPT-4o和Claude 3.7的86.7%,而双子座2.0.0的60.0%.
- 所有模型都错过了某些罕见的诊断,突出了可信但不正确的结果的风险.
结论:
- 聊天GPT-4o和Claude 3.7显示出诊断罕见皮肤病的巨大潜力.
- LLM可以作为临床医生有价值的辅助工具,尤其是皮肤病专业知识有限的临床医生.
- 进一步验证和整合到临床工作流程是必要的,以确保安全和有效的使用.


