PM2: 一个新的提示多模式模型范式,用于少数镜头医学图像分类
Zhenwei Wang1, Qiule Sun2, Bingbing Zhang3
1Key Laboratory of Social Computing and Cognitive Intelligence (Ministry of Education), Dalian University of Technology, Dalian, 116024, China; School of Computer Science and Technology, Dalian University of Technology, Dalian, 116024, China; School of Computer Science and Engineering, Dalian Minzu University, Dalian, 116600, China.
Computer methods and programs in biomedicine
|September 10, 2025
概括
这项研究介绍了PM2,这是一种用于医学图像分类的新型多模基础模型. 通过整合文本提示和视觉令牌功能,PM2 增强了少量拍摄的学习,在各种医疗数据集上实现了最先进的性能.
科学领域:
- 人工智能的人工智能
- 医疗成像医学成像
- 计算机视觉 计算机视觉
背景情况:
- 由于有限的数据和注释挑战,对医疗图像分类来说,少数镜头的学习至关重要.
- 单模方法不足以在医学图像中捕捉复杂的概念类别.
- 需要一个全面的策略来有效地解释医疗图像内容.
研究的目的:
- 提出一种新的医疗图像分类范式,PM2,利用一个多模式基础模型.
- 通过在图像数据旁边加入补充文本提示来增强跨模式的短暂学习.
- 提高医学图像分类模型的表示能力.
主要方法:
- 开发了PM2,一个多模式的基础模型,包含图像和文本 (提示) 模式.
- 调查了五个提示方案来描述图像和概念类别.
- 在类令牌和视觉令牌特征分布上采用线性分类.
- 利用全球共变量聚合与矩阵功率规范化用于视觉令牌聚合.
- 对于文本编码表示和视觉令牌特征的组合分类头.
主要成果:
- 在三个数据集中,PM2显著提高了医学图像分类性能:乳腺癌,脑瘤和糖尿病视网膜病变.
- 与现有的多模式方法相比,拟议的模型取得了最先进的结果.
- 整合文本提示作为补充数据有效地增强了模型性能.
结论:
- 文本提示有效地增加了医疗图像分类性能,在几次拍摄的学习环境中.
- 利用视觉令牌的二级特征丰富了该类别的特征空间.
- 将视觉令牌特征与类令牌表示相结合,可以加强模型的整体容量.


