数据泄露对基于连接组的机器学习模型的影响
Matthew Rosenblatt1, Link Tejavibulya2, Rongtao Jiang3
1Department of Biomedical Engineering, Yale University, New Haven, CT.
bioRxiv : the preprint server for biology
|January 18, 2024
概括
神经成像预测模型中的数据泄露可以膨胀性能,特别是在特征选择或重复对象的情况下. 避免泄漏对于有效和可重复的脑行为关系研究至关重要.
科学领域:
- 神经成像是一种神经成像.
- 机器学习 机器学习
- 大脑与行为关系 大脑与行为关系
背景情况:
- 预测建模是神经成像中的关键,以了解大脑与行为之间的联系.
- 数据泄露,或培训和测试集之间的无意信息泄露,损害了模型的有效性.
- 以前的研究表明,泄漏在机器学习中很常见,但它对神经成像的具体影响不太清楚.
研究的目的:
- 实证地评估各种数据泄露形式对神经成像预测模型的影响.
- 调查泄漏如何影响不同数据集和表型的功能和结构连接组分析.
- 了解泄漏对预测性能,模型解释性和对数据集大小敏感性的后果.
主要方法:
- 研究了五种类型的数据泄露,分为三个类别:特征选择,共变量校正和缺乏独立性.
- 在四个大型神经成像数据集和三种表型 (功能和结构连接体) 上利用了400多条管道.
- 评估泄漏对预测准确度,模型系数和神经生物学解释的影响.
主要成果:
- 通过特征选择和重复对象的泄漏显著增加了预测性能.
- 其他泄漏类型,如位点校正,具有轻微影响,而泄漏的共同变量回归甚至降低了性能.
- 泄漏影响了模型系数,可能改变神经生物学解释.
- 较小的数据集更容易受到数据泄露的不利影响.
结论:
- 数据泄露对神经成像预测模型具有可变的影响,从性能通货膨胀到性能下降.
- 了解这些影响凸显了严格处理数据的必要性,以确保神经成像研究的有效性和可重复性.
- 避免数据泄露对于准确识别大脑行为关系和可靠的发现概括性至关重要.


