利用视觉语言模型与自然文本监控来进行MRI检索,标题,分类和视觉问题答案
bioRxiv : the preprint server for biology
|March 3, 2025
概括
这项研究引入了使用自然语言监督进行大脑MRI分析的新框架,使得阿尔茨海默病研究的检索和问答等多功能任务成为可能.
科学领域:
- 人工智能的人工智能
- 医疗成像医学成像
- 神经科学是一个神经科学.
背景情况:
- 大型多式联运模型被广泛使用,但在医疗应用中,人们对数据质量,领域相关性和隐私存在担忧.
- 放射学当前的深度学习模型通常是特定于任务的,缺乏自然语言交互能力.
研究的目的:
- 利用自然语言监督开发一种多功能框架,用于学习视觉大脑MRI概念.
- 为了实现多个下游任务,包括MRI检索,标题,分类和视觉问题答案.
- 在脑MRI中调查影响阿尔茨海默病 (AD) 的因素的识别.
主要方法:
- 利用矢量检索和对比学习来实现高效的概念学习.
- 雇员自主监督学习预培训单独的文本和图像编码器.
- 共同微调编码器以创建跨模式学习的共享嵌入空间.
- 开发了一个检索和重新排名的机制与变压器解码器用于视觉问题答案.
主要成果:
- 该框架通过联合嵌入和自然语言监督成功地学习识别影响阿尔茨海默病 (AD) 的因素.
- 证明模型能够执行多个任务:MRI检索,标题和分类.
- 通过检索/重新排名机制和变压器解码器展示了多功能性,用于视觉问题解答.
结论:
- 拟议的框架通过将医疗成像与文本相结合,为放射学研究提供了一个通用和多功能工具.
- 能够在AD研究中进行诊断和预后评估,并通过检测文本中描述的放射性特征来协助临床医生.
- 代表了放射学研究的新方法,增强了多式模式在医疗保健中的实用性.


