跨模式自主监督视觉语言预培训,具有多个目标,用于医学视觉问题答案
Gang Liu1, Jinlong He1, Pengfei Li1
1College of Computer Science and Technology, Harbin Engineering University, Harbin, 150001, Heilongjiang, China.
Journal of biomedical informatics
|November 13, 2024
概括
本研究介绍了医疗视觉问题答案 (VQA) 的多重目标 (CMMO) 交叉模式预培训. 通过将医疗图像特征与文本概念对齐,CMMO显著提高了VQA的性能,在多个数据集上表现优于现有的方法.
科学领域:
- 人工智能的人工智能
- 医疗成像医学成像
- 自然语言处理自然语言处理.
背景情况:
- 医学视觉问题答案 (VQA) 需要整合视觉和文本数据,但缺乏大规模的注释数据集来进行端到端的培训.
- 现有的方法在为VQA任务进行微调之前,对图像标题数据集进行预训练模型.
研究的目的:
- 开发一种新的预培训方法,多重目标的跨模式预培训 (CMMO),以提高医疗VQA模型的性能.
- 改善医疗图像特征和文本概念之间的对齐,以便更好地进行多模式推理.
主要方法:
- 利用公共医疗图像标题数据集进行自主监督的多式模式模型预训练.
- 实现了CMMO,结合了掩面图像建模,掩面语言建模,图像-文本匹配和对比学习.
- 在下游医疗VQA任务上微调预训练模型.
主要成果:
- 该CMMO方法在三个公共医疗VQA数据集上取得了最先进的结果:VQA-RAD,PathVQA和SLAKE.
- 在VQA-RAD上表现出2.6%的绝对性能改善,在PathVQA上为0.9%,在SLAKE上为4.0%.
- 剥离研究和注意力图可视化证实了该方法的有效性和可解释性.
结论:
- 拟议的CMMO方法有效地解决了有限的注释医学VQA数据的挑战.
- CMMO增强了多模式交互和特征表示对齐,从而带来了卓越的医疗VQA性能.
- 释放代码和预训练重量有助于进一步研究医疗VQA.


