膀癌激进囊切除术后的生存率:开发一个公平的机器学习模型
Samuel Carbunaru1, Yassamin Neshatvar1, Hyungrok Do2
1Department of Urology, New York University School of Medicine, New York, NY, United States.
JMIR medical informatics
|December 13, 2024
概括
对于膀癌生存预测的机器学习模型显示了患者子组之间的偏差. 应用公平技术改善了模型的公平性,导致了第一个公平的机器学习工具,用于生存预测.
科学领域:
- 在瘤学瘤学.
- 生物统计学 生物统计学
- 医疗信息学 医疗信息学
背景情况:
- 机器学习 (ML) 模型在医疗保健中越来越多地使用,但可能会表现出偏见,导致不同人口子组的不公平表现.
- 这种偏见是膀癌的一个重大问题,在性别和种族群体之间存在着已知的差异.
研究的目的:
- 开发一种ML模型,用于预测膀癌患者的激进囊切除术后的生存率.
- 评估开发的模型对跨性别和种族子组的潜在偏见的评估.
- 将不同的技术进行比较,以减轻算法不公平性和提高模型公平性.
主要方法:
- 使用国家癌症数据库训练并比较各种ML分类算法,以预测激进囊切除术后的5年生存率.
- 使用F1得分和使用均等赔率比率 (eOR) 的公平性来评估模型性能.
- 比较了三个算法不公平缓解技术,以提高eOR.
主要成果:
- 性能最好的天真模型 (极端梯度提升) 实现了F1得分为0.860和eOR为0.619.
- 所有测试的缓解技术都改善了eOR,其中相关性删除技术的增幅最高,达到0.750.
- 缓解模型在各种各样的子组中保持了强的表现,F1得分为0.86 (总体),0.904 (黑人男性) 和0.824 (亚洲女性).
结论:
- 膀癌存活率预测的初始ML模型显示了性别和种族子组之间的偏见.
- 算法不公平缓解技术有效地提高了模型的公平性,正如增加的eOR所表明的那样.
- 这项研究强调了评估和积极减轻ML模型偏差的重要性,以确保公平的医疗保健服务,最终为此目的部署了第一个基于Web的公平ML模型.


