通过视觉对齐利用文本洞察力进行医学图像细分
IEEE transactions on medical imaging
|August 21, 2025
概括
TeViA通过对准文本和视觉特征来增强医疗图像的细分,从而提高准确性. 这种新的方法克服了当前视觉语言模型中的语义转移和调整问题,实现了显著的性能提升.
科学领域:
- 计算机视觉
- 医学图像分析
- 人工智能
背景情况:
- 视觉语言模型 (VLM) 和语言模型 (LM) 在视觉任务中集成文本和图像数据方面具有前景.
- 目前的文本增强医学图像细分方法与语义转移扎, 视觉和文本组件之间出现错位.
研究的目的:
- 提出TeViA,这是医疗图像细分中各种视觉和文本模型无整合的新方法.
- 在细分任务中解决语义转移和改进文本视觉对齐.
主要方法:
- TeViA采用了针对细分的文字与视觉对齐策略.
- 它使用前景视觉表示来监督投影层,并改进对细分的文本特征.
- 一个历史性的视觉原型,通过动量更新,增强实例表示和完善文本特征.
主要成果:
- 在5个公共医疗图像细分数据集中,TeViA表现出卓越的性能.
- 与仅视觉方法相比,该方法实现了超过6%的改善.
- 这种方法在文本增强细分中确保了信息获取和语义一致性.
结论:
- 通过改进文本视觉对齐,TeViA为文本增强的医疗图像细分提供了有效的解决方案.
- 该方法的灵活性允许与各种预先训练的模型集成,无论它们的初始关系如何.
- TeViA 显著提升了医疗图像细分精度的最新技术.


