通过计算病理学模型错误诊断的人口偏见
Anurag Vaidya1,2,3,4,5, Richard J Chen1,2,3,4,6, Drew F K Williamson1,2,7
1Department of Pathology, Brigham and Women's Hospital, Harvard Medical School, Boston, MA, USA.
Nature medicine
|April 19, 2024
概括
计算病理学的深度学习显示了人口群体之间的绩效差距,特别是代表性不足的人口群体. 先进的自我监督模型可以减少这些差异,但不能消除它们,因此需要持续缓解偏差.
科学领域:
- 计算病理学计算病理学
- 医学中的人工智能.
- 生物医学信息学是生物医学信息学.
背景情况:
- 计算病理学的深度学习模型越来越受欢迎,但可能会表现出性能偏差.
- 在计算病理学中使用的公共数据集往往低于某些人口群体,加剧了偏见的担忧.
研究的目的:
- 研究基于深度学习的计算病理系统中的人口绩效差异.
- 评估自我监督视觉基础模型在缓解这些偏见方面的有效性.
- 为评估计算病理学工具的监管准则提供信息.
主要方法:
- 来自癌症基因组图谱,EBRAINS脑瘤图谱和内部患者数据的全幻灯片图像的分析.
- 评估深度学习模型用于乳腺和肺癌的亚型和预测质瘤中的IDH1突变.
- 包括种族在内的人口群体之间的性能比较,使用接收器运行特征曲线 (AUC) 下的面积.
- 从自我监督的视觉基础模型和偏差缓解策略中评估特征表示.
主要成果:
- 在癌症亚型和突变预测任务中,在人口群体之间观察到显著的绩效差异.
- 例如,白人和黑人患者之间的AUC差距达到16.0%,用于预测质瘤中的IDH1突变.
- 自主监督的视觉基础模型比传统模型或偏差缓解技术更有效地减少了群体之间的性能差异.
- 这些模型并没有完全消除差异,并且除了种族之外的其他人口因素也存在偏差.
结论:
- 计算病理学的深度学习模型表现出人口统计学性能偏差,影响公平和公平.
- 自主监督视觉基础模型在减少这些偏见方面表现有希望,但需要进一步开发和整合偏见缓解策略.
- 人口分层评估应纳入对计算病理学工具的监管评估指南,以确保公平的绩效.


