HLAEquity:检查泛等位素-HLA结合预测器中的偏差
Anja Conev1, Romanos Fasoulis1, Sarah Hall-Swan1
1Department of Computer Science, Rice University, Houston, TX, USA.
iScience
|January 8, 2024
概括
机器学习-HLA (pHLA) 预测器显示偏差. 数据集过度代表高收入人群,导致低收入人群的表现差,并挑战了"泛基因"模型概念.
科学领域:
- 免疫信息学和计算生物学
- 个性化医学和疫苗开发
背景情况:
- -HLA (pHLA) 结合的预测对于识别个性化疫苗的候选人至关重要.
- 机器学习 (ML) 模型被广泛用于pHLA结合预测,经常声称"泛基因"概括.
- 现有的pHLA数据集表现出不平衡的等位基因表征,引发了对模型性能偏差的担忧.
研究的目的:
- 调查基于ML的泛等位基PHLA结合预测器中的数据偏差.
- 评估数据偏差对不同地理群体模型性能的影响.
- 评估"泛基因"描述符对当前ML模型的适用性.
主要方法:
- 检查公开的pHLA数据集中的等位基因代表性.
- 对基于ML的两种基于全基因的pHLA结合预测器进行性能差异分析.
- 模型性能与HLA等位基因的地理起源的相关性.
主要成果:
- 在pHLA数据集中,来自高收入国家的HLA等位基因显著过度代表.
- 这种数据不平衡导致算法偏差,导致低收入人口中普遍存在的等位基因表现不佳.
- 在这些数据集上训练的ML模型延续和放大现有的数据偏差.
结论:
- 目前基于ML的pHLA结合预测工具由于不平衡的训练数据而表现出显著的性能偏差.
- 对于在当前的公共数据集上训练的模型来说",泛基因"一词是误导性的,因为它们不会在所有人群中公平地概括.
- 解决数据偏差对于确保个性化疫苗开发中的公平治疗结果至关重要.


