评估NetMHCpan对非欧洲HLA基因基因的性能,这些基因基因基因基因基因基因基因基因基因基因基因基因基因基因基因基因基因基因基因基因基因基因基因基因基因基因基因基因基因基因基因基因基因基因基因基因基因基因基因基因基因基因基因基因基
Thomas Karl Atkins1, Arnav Solanki1, George Vasmatzis2
1Department of Electrical and Computer Engineering, University of Minnesota, Minneapolis, MN, United States.
Frontiers in immunology
|January 31, 2024
概括
对医疗保健应用程序的机器学习模型的调查对公平性至关重要. 尽管训练数据对某些种族有偏见,但NetMHCpan-4.1和NetMHCIIpan-4.0在代表性不足的群体的预测准确度没有显著下降.
科学领域:
- 免疫信息学是指免疫信息学.
- 计算生物学 计算生物学
- 医疗保健中的机器学习
背景情况:
- 神经网络训练数据集中的偏差可以降低代表性不足的群体的预测准确性,影响医疗保健应用.
- 像NetMHCpan-4.1和NetMHCIIpan-4.0这样的机器学习模型可以预测抗原与MHC分子的结合,这对于自适应性免疫反应至关重要.
- 之前的研究表明,这些模型可能会偏向疏水性.
研究的目的:
- 调查NetMHCpan-4.1和NetMHCIIpan-4.0的培训数据集的组成,重点关注种族代表性.
- 评估这些模型对未包括在训练数据集中的等位基因的预测准确度.
- 了解训练数据差异,HLA序列多样性和预测性能之间的关系.
主要方法:
- 针对种族偏见的培训数据集组成分析 (欧洲高加索人,亚洲人,太平洋岛民).
- 在训练数据中缺少的等位基因上测试NetMHCpan-4.1和NetMHCIIpan-4.0的性能.
- 绘制HLA序列空间以评估训练数据集多样性.
- 将NetMHCpan预测中的具有影响力的残留物与特定等位基因的结构特征联系起来.
主要成果:
- 发现NetMHCpan-4.1和NetMHCIIpan-4.0的培训数据集严重偏向亚洲和太平洋岛屿居民,偏向欧洲白人.
- 意想不到的是,尽管发现了种族差异,但在培训数据中不存在的等位基因中没有观察到预测质量的有意义的差异.
- 分析揭示了培训数据集的序列多样性,并将关键预测残留物与结构特征联系起来.
结论:
- 对于MHC结合预测模型的训练数据中的种族偏见并不一定意味着代表性不足的等位基因的预测质量下降.
- 对HLA序列空间和结构特征的进一步研究是必要的,以充分理解模型行为和潜在的偏差.
- 确保医疗保健中机器学习模型的公平性能需要仔细考虑培训数据的组成及其对不同人群的影响.


