使用皮肤镜图像评估GPT-5用于黑色素瘤检测
Qingguo Wang1, Ihunna Amugo2, Harshana Rajakaruna3
1Department of Biochemistry, Cancer Biology, Neurosciences and Pharmacology, School of Medicine, Meharry Medical College, Nashville, TN 37208, USA.
Diagnostics (Basel, Switzerland)
|December 11, 2025
概括
像GPT-5这样的大型语言模型显示出早期黑色素瘤检测的前景. GPT-5显示出更好的诊断准确性,特别是在差异诊断中,优于之前的GPT-4模型.
科学领域:
- 人工智能的人工智能
- 皮肤病学 皮肤病学
- 医疗成像医学成像
背景情况:
- 黑色素瘤是一种致命的皮肤癌,早期发现对生存至关重要.
- 人工智能 (AI),特别是大型语言模型 (LLM),为改善早期黑色素瘤检测提供了潜力.
- 缺乏针对黑色素瘤检测的LLM,如GPT-5的系统评估.
研究的目的:
- 评估GPT-5在皮肤镜图像上的诊断性能,以检测黑色素瘤.
- 将GPT-5的功能与之前的GPT-4模型进行比较,以对皮肤病变进行分类.
主要方法:
- 在600张来自ISIC档案和HAM10K数据集的皮肤镜像上测试了GPT-5.
- 该模型执行了三个诊断任务:初级诊断,前三差异诊断和恶性瘤歧视.
- 使用灵敏度,特异性,准确性和F1得分与经过组织病理学验证的基底真相来衡量性能.
主要成果:
- 在初级诊断中,GPT-5的准确性很小,但在差异诊断中显著提高了性能 (灵敏度>93%,特异性>86%).
- 对于恶性瘤的区分,GPT-5与GPT-4变体相比,表现出更平衡的敏感性和特异性.
- 在差异诊断准确度和整体分类可靠性方面,GPT-5的表现优于GPT-4模型.
结论:
- 在皮肤病学中,GPT-5显示出作为临床决策支持工具的巨大潜力,在差异诊断中超过了GPT-4衍生物.
- 该模型在黑色素瘤检测方面有助于医学教育的能力得到了强调.
- 建议谨慎使用,因为GPT-5倾向于将黑色素瘤错误分类为良性,需要进一步细化.


