从目光到洞察力:桥梁人类视觉注意力和视觉语言模型解释为弱监督医疗图像细分的解释
IEEE transactions on medical imaging
|October 6, 2025
概括
这项研究引入了医疗图像细分的新型教师-学生框架,有效地结合了临床医生的目光数据和视觉语言模型 (VLMs). 这种方法可以提高细分的准确性,而不会增加注释成本,从而改善诊断AI系统.
科学领域:
- 医学图像分析 医学图像分析
- 人工智能在医学中的应用
- 计算机视觉 计算机视觉
背景情况:
- 医疗图像细分至关重要,但受到高标注成本的阻碍.
- 现有的弱监督方法,如临床医生的目光数据,稀少,视觉语言模型 (VLMs) 缺乏精度.
- 无论是眼神还是语言监督,都不足以实现准确的细分.
研究的目的:
- 通过整合临床医生的目光和VLM监督来开发一个注释效率高的医疗图像细分方法.
- 为了利用视线数据 (在哪里) 和VLM (为什么) 的互补优势来改进细分.
- 提高人工智能系统在医学诊断中的解释性和部署性.
主要方法:
- 提出了一个教师-学生框架,其中一个教师模型从VLM生成的病变描述中增强的目光点中学习.
- 教师通过多尺度特征对齐,信心加权一致性约束和自适应性掩盖来引导学生.
- 该框架将人类的视觉注意力与人工智能生成的语义上下文集成在一起.
主要成果:
- 拟议的方法获得了高分数: 80.78% (Kvasir-SEG),80.53% (NCI-ISBI) 和84.22% (ISIC).
- 在没有额外的注释负担的情况下,性能比只注视的基线提高了3-5%.
- 该框架通过保持预测,目光和病变描述之间的相关性来保持临床解释性.
结论:
- 整合人类的目光和VLM语义环境有效地克服了个体弱监督信号的局限性.
- 开发的框架为医疗人工智能提供了注释效率高的方法,推进了可部署的细分系统.
- 这项工作突出了将人类注意力和人工智能结合起来,实现强大的医疗图像分析的潜力.


