通过2D多模大型语言模型的辅助进行预训练来提高3D医疗图像的理解
IEEE journal of biomedical and health informatics
|September 15, 2025
概括
Med3DInsight通过将3D编码器与2D多模式大语言模型 (MLLMs) 集成来增强3D医疗图像的理解. 这种新的框架在分段和分类方面实现了最先进的性能,没有人类注释.
科学领域:
- 医疗成像医学成像
- 人工智能的人工智能
- 计算机视觉 计算机视觉
背景情况:
- 目前的3D医疗图像分析方法,包括卷积和基于变压器的自我监督学习 (SSL),经常与深度语义理解扎.
- 多模式大语言模型 (MLLMs) 显示了通过文本集成来提高图像理解的潜力.
研究的目的:
- 推出Med3DInsight,一个新的预培训框架,旨在通过利用2D MLLMs来增强3D医学图像的理解.
- 为3D医疗数据开发一种可扩展的多式模式表示学习方法,而不需要手动注释.
主要方法:
- 整合3D图像编码器与2D MLLM使用平面切片感知变压器模块.
- 在LLM生成的内容中使用基于运输的部分最佳对齐以提高噪声耐受性.
- 开发一种自我监督的学习框架,用于多模式的3D医学表现学习.
主要成果:
- 在CT和MRI数据集中的医疗图像细分和分类任务中实现了最先进的性能.
- 在下游任务评估中表现优于现有的自我监督学习方法.
- 通过最佳的运输对齐,在LLM生成的内容中证明了对噪声的稳定性.
结论:
- Med3DInsight为多式3D医学表示学习提供了一个新的范式,提高语义理解.
- 该框架可以无地集成到现有的3D医学图像分析网络中,以提高性能.
- 这种方法使3D医学成像的可扩展,无注释的学习成为可能.


