EndoViT:在大量内镜图像集合上预训练视觉转换器
Dominik Batić1, Felix Holm2,3, Ege Özsoy1
1Chair for Computer Aided Medical Procedures, Technical University Munich, Munich, Germany.
概括
使用EndoViT进行特定领域的自我监督预训显著改善了自动化内镜视频分析. 这种方法提高了复杂的外科手术任务的性能,如动作三重点识别和语义细分,优于一般预训练方法.
科学领域:
- 医学计算机视觉 医学计算机视觉
- 手术数据科学手术数据科学
背景情况:
- 自动内镜视频分析对于手术辅助至关重要,但由于复杂的场景和有限的注释数据而受到阻碍.
- 在NLP和计算机视觉方面取得成功的大规模预训练,通过减少对注释医疗数据的依赖,提供了一个解决方案.
研究的目的:
- 调查内镜领域特定的视觉转换器 (ViT) 自主监督预训的有效性.
- 开发和评估EndoViT,一个ViT预训练在一个大型内镜图像集,用于手术下游任务.
主要方法:
- 收集了Endo700k,这是来自九个Minimally Invasive Surgery (MIS) 数据集的700,000多张内镜图像的最大公共数据库.
- 介绍了EndoViT,这是一个预先在Endo700k体内训练的视觉转换器.
- 对各种下游手术任务进行了EndoViT的评估,包括动作三重识别和语义细分.
主要成果:
- 与ImageNet预训练相比,EndoViT在复杂的下游任务中表现出了显著的优势.
- 在动作三重识别中取得了卓越的性能.
- 在语义细分任务中超越了最先进的 (SOTA) 性能.
结论:
- 特定领域的大规模自我监督预培训对视觉转换器在医疗计算机视觉中非常有益.
- EndoViT有效地解决了自动化内镜视频分析方面的挑战.
- 代码和预训练模型被释放以促进进一步的研究.


