利用预先训练有素的视觉语言模型,通过多视图乳房造影进行增强乳腺癌诊断
Xuxin Chen1, Yuheng Li1,2, Mingzhe Hu1,3
1Department of Radiation Oncology and Winship Cancer Institute, Emory University, Atlanta, Georgia, USA.
Medical physics
|January 14, 2026
概括
使用对比性语言图像预训练 (CLIP) 的新方法Mammo-CLIP显著改善了用于乳腺癌检测的多视图乳房扫描分析. 这种方法比现有的最先进的技术提高了诊断准确度.
科学领域:
- 医疗成像中的人工智能
- 计算机辅助诊断 (CAD) 是一种计算机辅助诊断.
- 视觉语言模型 视觉语言模型
背景情况:
- 多视图乳房扫描分析对于准确的乳腺癌检测至关重要.
- 开发有效的多视图CAD方案仍然具有挑战性,限制了临床应用.
研究的目的:
- 为应对多视图特征融合和CAD高效模型微调方面的挑战.
- 适应对比性语言图像预训练 (CLIP) 进行多视图乳房图分析.
主要方法:
- 介绍了Mammo-CLIP,这是一个处理多视图乳房影像和文本的多模式框架.
- 早期使用的功能融合用于多视图关系学习,以及用于高效微调的插即用适配器 (约. 1% 的参数更新).
- 在两个追溯数据集上进行评估,用于少量学习,内部验证和概括性测试.
主要成果:
- 与最先进的交叉视图变压器相比,Mammo-CLIP实现了更高的性能 (AUC = 0.841 ± 0.017 与 0.817 ± 0.012 相比).
- 在AUC方面表现比以前基于CLIP的方法优于20.3%和14.3%.
- 在单独的数据集上表现出强大的概括性.
结论:
- 马莫-CLIP显示了提高乳腺癌诊断准确性的巨大潜力.
- 突出了微调视觉语言模型在开发先进的多视图,图像文本基于CAD系统的实用性.

