转换器的蒙面预训练用于组织学图像分析
Shuai Jiang1, Liesbeth Hondelink1, Arief A Suriawinata2
1Department of Biomedical Data Science, Geisel School of Medicine at Dartmouth, Hanover, NH 03755, USA.
Journal of pathology informatics
|July 15, 2024
概括
MaskHIT是一个自我监督的视觉变换器 (ViT) 模型,有效地预训练了数字病理学任务的整片图像 (WSI). 这种方法增强了用于癌症诊断和预测的WSI分析,优于现有的方法.
科学领域:
- 数字病理学数字病理学
- 计算病理学计算病理学
- 医学中的人工智能.
背景情况:
- 全幻灯片图像 (WSIs) 在数字病理学中对于癌症诊断和预后至关重要.
- 视觉变压器 (ViT) 模型对分析WSIs具有前景,但由于参数数量大和标记数据有限,面临挑战.
研究的目的:
- 为应用到WSIs的ViT模型开发一种自我监督的预培训方法.
- 提高ViT模型在WSI级任务上的性能,例如生存预测,癌症亚型分类和等级预测.
主要方法:
- 提出 MaskHIT,这是一个新的借口任务,用于对 WSIs 的变压器模型进行自我监督的预训.
- 利用对比损失来根据变压器输出重建掩盖的补丁.
- 从癌症基因组图谱 (TCGA) 中预先训练了MaskHIT模型的7000多个WSI.
主要成果:
- 使用MaskHIT进行预训练,可以实现对组织学特征的上下文意识的WSI理解和学习.
- 与多个实例学习和最先进的变压器方法相比,实现了卓越的性能.
- 在生存预测和癌症亚型分类任务上分别表现出3%和2%的改善.
- 来自MaskHIT的注意力图与病理学家的注释保持一致,识别出临床相关的结构.
结论:
- 自主监督的预培训对于在WSI级任务上获得最佳ViT表现至关重要.
- MaskHIT可以根据补丁位置和视觉模式提取代表性组织学特征.
- 该模型准确地识别出临床相关的组织结构,有助于癌症诊断和预后.


