对公共大脑MRI数据集进行结构化审查和定量分析,用于基础模型开发.
Minh Sao Khue Luu1, Margaret V Benedichuk1, Ekaterina I Roppert1
1The Artificial Intelligence Research Center, Novosibirsk State University, 630090 Novosibirsk, Russia.
Journal of imaging
|December 24, 2025
概括
公共大脑MRI数据集在规模,多样性和预处理方面显示出显著的变化,阻碍了基础模型的开发. 单独协调是不够的;对于可通用模型,预处理意识和域适应策略至关重要.
科学领域:
- 神经成像是一种神经成像.
- 人工智能的人工智能
- 医学数据科学 医学数据科学
背景情况:
- 大脑MRI的基础模型需要大量,多样化和一致的数据集.
- 缺乏对公共大脑MRI数据进行系统评估,以开发基础模型.
研究的目的:
- 系统地评估公开可用的脑MRI数据集的规模,多样性和一致性.
- 评估预处理变异性对数据协调的影响.
- 为了告知可通用的大脑MRI基础模型的发展.
主要方法:
- 在数据集和图像层面分析了54个公共大脑MRI数据集 (538,031次扫描).
- 在14个数据集中量化图像属性 (音符间距,方向,强度).
- 评估预处理步骤 (规范化,偏差纠正,注册等). 以及它们对数据的影响.
- 使用3D DenseNet121进行特征空间分析,以评估剩余的协变量转移.
主要成果:
- 在公共MRI数据集中,大型健康群体和较小的临床群体之间存在显著的不平衡.
- 在数据集中,图像属性 (语音间距,方向,强度) 的实质性异质性.
- 标准化预处理提高了数据集内部的一致性,但留下了剩余的数据集间差异.
- 即使在协调之后也观察到剩余的共变量转移,这表明仅协调的局限性.
结论:
- 公共大脑MRI资源表现出相当大的变化,这给基础模型开发带来了挑战.
- 单独的协调策略不足以克服数据集间偏差.
- 预处理意识和域适应性方法对于创建强大和可泛化的大脑MRI基础模型至关重要.


