手术-DINO:在内镜手术中用于深度估计的基础模型的适应器学习
Beilei Cui1, Mobarakol Islam2, Long Bai1
1The Chinese University of Hong Kong, Hong Kong, China.
概括
本研究介绍了Surgical-DINO,这是一种使用低级适应 (LoRA) 的新方法,用于改善机器人手术中的深度估计. 手术DINO显著优于现有模型,证明了调整基础模型用于手术应用的有效性.
科学领域:
- 计算机视觉 计算机视觉
- 医疗机器人 医疗机器人
- 手术技术 手术技术
背景情况:
- 深度估计对于3D重建,导航和机器人手术中的增强现实至关重要.
- 像DINOv2这样的基础模型在一般视觉任务中表现出色,但在专业医疗领域存在局限性.
- 调整这些强大的模型用于外科应用需要特定领域的策略.
研究的目的:
- 提出一个低级适应 (LoRA) 方法,以提高外科手术深度估计的基础模型.
- 介绍Surgical-DINO,一种基于DINOv2的模型,专门适用于内镜手术深度估计.
- 为了证明LoRA在整合外科领域知识的有效性,而无需完全微调.
主要方法:
- 通过将LoRA层集成到DINOv2架构中开发了外科DINO.
- 结DINO图像编码器以利用其视觉表示功能.
- 仅优化了LoRA层和深度解码器,以结合手术场景的功能.
主要成果:
- 与SCARED内镜手术数据集上的最先进模型相比,外科DINO实现了更高的性能.
- 废弃性研究证实了LoRA层对模型适应的显著贡献.
- 该模型在内镜深度估计任务中表现出强的表现.
结论:
- 外科DINO强调了基础模型的成功适应,用于外科深度估计.
- 通过零射击预测或天真微调直接应用基础模型对于外科领域是不够的.
- 洛拉为医疗计算机视觉领域的域调整提供了一种有效的方法.


