在CLIP中进行语言增强,以改善多模体医学图像上的解剖学检测
概括
本研究引入了一种自动化系统,用于使用视觉语言模型在整个身体中生成全面的医疗图像描述. 这种新的方法显著改进了现有的多模式放射学报告生成方法.
科学领域:
- 医疗成像医学成像
- 人工智能的人工智能
- 计算机视觉 计算机视觉
背景情况:
- 视觉语言模型越来越多地用于医学中的多模式分类.
- 目前的自动化放射学报告生成仅限于特定的模式或身体区域.
- 需要能够生成全身,多模式描述的模型.
研究的目的:
- 为了自动生成标准化的身体站和器官列表,用于多模态MR和CT放射性图像.
- 为弥补目前关于全身,多模式图像描述的研究缺口.
主要方法:
- 利用对比性语言图像预训 (CLIP) 进行模型改进.
- 进行了实验,包括基线模型微调.
- 作为一个超级集和应用图像和语言增强的内置站.
主要成果:
- 与基线PubMedCLIP模型相比,实现了47.6%的性能改善.
- 证明了全身标准化机关站点和器官列表的成功自动化.
- 验证了增强和叠加方法的有效性,以改善相关性.
结论:
- 拟议的方法有效地自动化了全面的多模式放射性图像描述.
- 这一进步有可能提高放射学报告生成和临床工作流程.
- 未来的工作可以建立在这个模型上,用于更复杂的医学图像分析.


