AMVLM:半监督医疗图像细分的对齐多元感知视觉语言模型
IEEE transactions on medical imaging
|May 23, 2025
概括
低质量的伪标签阻碍了半监督的医疗图像细分. 调整-多重性意识视觉语言模型 (AMVLM) 通过解决跨模式调整挑战来提高伪标签质量和细分性能.
科学领域:
- 计算机视觉 计算机视觉
- 医疗成像医学成像
- 人工智能的人工智能
背景情况:
- 低质量的伪标签是半监督医疗图像细分 (SSMIS) 的一个主要挑战.
- 视觉语言模型 (VLM) 显示了提高伪标签质量的潜力,但与跨模式对齐不确定性作斗争.
- 由于基于分布的语义建模,现有的VLM方法可能会导致语义退化.
研究的目的:
- 引入一种新的VLM预训练范式,即对准-多重性意识视觉语言模型 (AMVLM).
- 提高伪标签质量,提高SSMIS中的一致性学习.
- 开发一个以文本为导向的SSMIS网络,利用预训练的AMVLM.
主要方法:
- 提出了对齐-多重性意识视觉语言模型 (AMVLM) 预训练范式.
- 引入交叉模式相似性监督 (CSS),使用概率分布变压器进行多重对齐.
- 实现了内部模式对比式学习 (ICL),以实现粗细细粒度的语义一致性.
- 开发了一个以文本为导向的SSMIS网络,并配备了用于多式联运监督的文本掩码生成器.
主要成果:
- 在AMVLM有效地解决跨模式对齐不确定性和语义退化.
- 拟议的CSS和ICL策略允许学习跨模式多重对齐和语义一致性.
- 由AMVLM驱动的SSMIS网络显著提高了伪标签质量和一致性学习.
- 与现有方法相比,在四个公共数据集中表现出卓越的性能.
结论:
- 在SSMIS中,AMVLM预培训范式为VLM挑战提供了一个强大的解决方案.
- 开发的以文本为导向的SSMIS网络有效地利用多式联运信息来提高细分精度.
- 这些发现突显了AMVLM在推进半监督医疗图像分析方面的潜力.

