减少生物医学机器学习中的人口偏差,用于使用cfDNA甲基化检测癌症
Shuo Li1, Weihua Zeng2, Wenyuan Li2
1Department of Pathology and Laboratory Medicine, David Geffen School of Medicine, University of California at Los Angeles, Los Angeles, CA, 90095, USA. shuoli@ucla.edu.
Genome biology
|February 24, 2026
概括
DeBias纠正生物医学机器学习数据集中的人口偏差,改善少数群体的癌症检测. 这种计算框架确保了在不同患者群体中更公平的AI预测.
科学领域:
- 生物医学数据科学是生物医学数据科学.
- 计算生物学是一种计算生物学.
- 机器学习在医疗保健中的应用
背景情况:
- 临床数据集中的人口不平衡导致有偏见的机器学习预测,使少数群体处于不利地位.
- 目前的偏差校正方法与生物医学数据异质性和复杂的人口因素作斗争.
研究的目的:
- 介绍DeBias,一个新的计算框架,旨在减轻高维度生物医学数据集中的人口偏差.
- 提高机器学习模型在生物医学研究中的公平性和准确性.
主要方法:
- DeBias使用控制样本从特征空间中识别和删除与偏差相关的子空间.
- 该框架允许全球纠正人口扭曲,同时保持关键的疾病特异信号.
- 应用于用于癌症检测的无细胞DNA甲基化数据.
主要成果:
- 德比亚斯显著减少了表现出人口偏差的特征.
- 在改善少数群体癌症检测性能方面表现优于现有方法.
- 在独立的队列中验证了性能增长,证明了稳健性.
结论:
- 德比亚斯为纠正生物医学机器学习中的人口偏见提供了一种有效和可泛化的策略.
- 代表着朝着公平的机器学习模型的进步,以便在不同患者群体中进行可靠,公正的预测.


