使用视觉转换器,医学标题和元数据融合的多模式皮肤疾病分类:对ISIC 2024数据集的分析
1Independent Researcher, Tahachal, Kathmandu, Kathmandu, Kathmandu, 44620, Nepal.
Biomedical physics & engineering express
|March 9, 2026
概括
这项研究通过将深度学习与临床数据相结合,提高了皮肤癌的诊断能力. 使用MedCLIP和患者元数据的多模式模型显著提高了分类皮肤病变的准确性.
科学领域:
- 皮肤病学和医学成像学
- 医疗保健中的人工智能
- 计算机视觉和自然语言处理
背景情况:
- 皮肤癌的诊断严重依赖于视觉检查和临床数据.
- 深度学习模型擅长图像分析,但往往忽视了有价值的临床元数据.
- 视觉语言模型 (VLMs) 在皮肤病学中显示出潜力,但多式联络整合需要进一步研究.
研究的目的:
- 评估基于MedCLIP的多式嵌入用于二进制皮肤病变分类.
- 分析不同融合策略的影响,将图像,文本和元数据结合起来.
- 评估使用多模式输入的经典和神经分类器的性能.
主要方法:
- 使用MedCLIP提取的图像-文本表示.
- 使用早期和基于注意力的机制,与患者元数据合并表示.
- 在精心策划的ISIC 2024数据集子集上使用多层感知器 (MLP) 和集合分类器.
主要成果:
- 在皮肤病变分类中达到96%的准确性 (95.7%准确) 和AUROC = 0.987.
- 超越了单模式基线模型的性能.
- 证明了将语言和元数据与视觉特征集成的互补价值.
结论:
- 基于MedCLIP的多模式学习显著提高了皮肤病变诊断的准确性.
- 有效的融合策略对于计算机辅助诊断中的视觉语言元数据系统至关重要.
- 这种方法强调了结合多种数据来源以改善皮肤病结果的重要性.
