与CAM交互的Vision GNN用于多标签医疗图像
IEEE journal of biomedical and health informatics
|October 16, 2025
概括
本研究引入了一种新的方法,CAM交互视觉GNN (CiV-GNN),通过使用类激活地图 (CAM) 构建类别意识图形来改进多标签医疗图像分类. 在医疗图像中,CiV-GNN增强了对象识别和类别区分能力.
科学领域:
- 计算机视觉 计算机视觉
- 人工智能的人工智能
- 医学成像分析 医学成像分析
背景情况:
- 视觉图表神经网络 (ViG) 使用图表级分析处理图像.
- ViG依赖外观级别的邻居忽视了类别语义,阻碍了多标签的医学图像学习.
- 医疗图像的像素级注释很少,阻止了对类别有意识的图形的直接构建.
研究的目的:
- 提出一种新的方法,CAM交互视觉GNN (CiV-GNN),用于改进多标签医疗图像学习.
- 通过在没有手动像素级注释的情况下整合类别语义来解决ViG的局限性.
- 增强医疗图像分析中的类别的独特性.
主要方法:
- 使用类激活地图 (CAM) 来定位特定类别的区域,无需手动注释.
- 引入一个类激活的补丁划分 (CAPD) 模块,用于由CAMs指导的类别意识图形构建.
- 开发一个多图交互处理 (MIP) 模块,以建模图间的关系,并促进类别间的学习.
主要成果:
- 在手术工具本地化和多标签医疗图像分类方面,CiV-GNN表现出强的性能.
- 与YOLOv8.8相比,在m2cai16本地化数据集上实现了mAP50的1.43%改善和mAP50-95的7.02%改善.
- 有效地将类别语义集成到图形构造中,以进行增强的图像分析.
结论:
- 通过CAM,CiV-GNN成功地克服了传统ViG的局限性,通过CAM将类别信息纳入.
- 拟议的方法为多标签医学图像学习提供了可行的解决方案,特别是当像素级注释不可用时.
- 在医学成像应用中,CiV-GNN显示了提高诊断准确性和定位的巨大潜力.


