一种监督机器学习方法,用于性别特定生物标志物预测的特征选择
Luke Meyer1, Danielle Mulder2, Joshua Wallace1
17 Long Tom Place Kanonberg Bellville Western Cape, Siriuz Pty Ltd., Cape Town, South Africa.
NPJ systems biology and applications
|July 2, 2025
概括
这项研究表明,当数据按性别分层时,用于预测临床生物标志物的机器学习 (ML) 模型的表现更好. 单独分析男性和女性的数据可以提高ML算法的预测准确度.
科学领域:
- 生物医学信息学 生物医学信息学
- 医疗保健中的机器学习
- 临床生物标志物发现发现
背景情况:
- 生物标志物对于疾病诊断,预后和治疗选择至关重要.
- 机器学习 (ML) 为识别新生物标志物和改进预测模型提供了强大的工具.
- 机器学习的一个重大问题是基于性别的偏见的可能性,影响了模型的概括性和公平性.
研究的目的:
- 开发一个监督的ML模型来预测9个常见的临床生物标志物.
- 调查基于性别的数据分层对ML模型性能的影响.
- 评估和减轻生物标志物预测的ML算法中的基于性别的偏见.
主要方法:
- 开发一个监督的ML模型来预测甘油三,BMI,腰围,静脉血压,血糖,尿酸,尿中的白蛋白与肌素的比率,高密度脂蛋白和白蛋白尿.
- 使用预测错误率 (在实际值的5-10%以内) 评估模型性能.
- 使用性别分层数据与组合数据 (以或没有性别作为特征) 对模型性能进行比较分析.
主要成果:
- 对于所选的临床生物标志物,ML模型实现了在5-10%的误差范围内的预测准确度.
- 在10%的误差范围内进行预测的高性能模型包括腰围,白膜尿,BMI,血糖和静脉血压.
- 与组合数据集相比,性别分层分析显示出更高的性能;使用没有性别作为特征的组合数据的模型表现最差.
结论:
- 按性别分层数据显著有利于基于ML的模型在临床生物标志物预测方面的性能.
- 解决性别作为生物变量的问题对于在医疗保健中开发准确和公正的ML算法至关重要.
- 这种方法提高了临床决策和个性化医学的ML模型的可靠性.


