公开可用的三角镜大语言模型:与皮肤科医生进行一对一的比较
Basil Signer1, Ali Mokhtari2, Simone Cazzaniga1
1Department of Dermatology, Inselspital, Bern University Hospital, 3010 Bern, Switzerland.
Diagnostics (Basel, Switzerland)
|January 10, 2026
概括
大型语言模型 (LLM) 在三眼镜中显示出有限的诊断准确性,显著低于人类专家的表现. 需要进一步开发人工智能,以可靠地协助诊断头发和头皮疾病.
科学领域:
- 皮肤病学 皮肤病学
- 人工智能的人工智能
- 医疗成像医学成像
背景情况:
- 三镜对于诊断头发和头皮疾病至关重要,需要大量的专业知识.
- 公开使用的大型语言模型 (LLM) 在三角学中的诊断实用性仍然未被探索.
- 这项研究评估了LLM在解释三光镜图像中的准确性,与人类皮肤科医生相比.
研究的目的:
- 为了评估四个LLM的诊断准确性在三光镜图像解释.
- 为了比较LLM的表现与皮肤病学住院医生,董事会认证的皮肤病学家和三叶病学专家.
- 确定人工智能在辅助三学诊断方面的潜力.
主要方法:
- 一项前性比较研究,使用一组预处理的结构转换的三光镜图像.
- 15名皮肤科医生 (居民,董事会认证,专家) 提供了疑似和差异诊断.
- 四个LLM (ChatGPT-4o,Claude Sonnet 4,Gemini 2.5 Flash,Grok-3) 在相同的条件下评估了图像.
主要成果:
- 人类皮肤科医生在疑似诊断方面实现了整体诊断准确率58.1%,在疑似+差异诊断方面达到68.3%.
- 人工智能模型的准确性较低:可疑诊断为18.2%,可疑+差异诊断为44.4%.
- 双子座2.5闪光显示出最高的AI准确性 (62.5%的疑似+差异诊断),但所有AI模型的表现明显低于人类专家 (p < 0.001).
结论:
- 目前,公开的LLM在三镜诊断方面表现低于人类专家,特别是在单一正确诊断方面.
- 人工智能模型在自己之间显示了中等到良好的协议,但与皮肤科医生只显示了微小到公平的协议.
- 专业培训和进一步发展对于LLM成为常规三学护理中可靠的工具至关重要.


