SDA-CLIP:使用视频和文本标签进行外科视觉域调整
Yuchong Li1,2, Shuangfu Jia3, Guangbi Song4
1Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences, Shenzhen, China.
Quantitative imaging in medicine and surgery
|October 23, 2023
概括
这项研究引入了一种新的域适应方法,SDA-CLIP,用于手术动作识别. 该方法通过将虚拟现实和临床数据相结合,显著提高了准确性,超过了现有的挑战基准.
科学领域:
- 计算机视觉 计算机视觉
- 医疗机器人 医疗机器人
- 机器学习 机器学习
背景情况:
- 手术动作识别对于自主手术至关重要,但由于临床数据稀缺而受到限制.
- 虚拟现实 (VR) 模拟通过域调整为算法开发提供了可扩展的解决方案.
- 将VR训练模型适应临床环境可以降低数据成本,并保护患者的隐私.
研究的目的:
- 开发一个领域适应方法,用于跨领域的外科手术动作识别.
- 为了利用对比的语言图像预训练来弥合VR和临床外科数据.
- 通过使用模拟数据,提高临床环境中手术动作识别的准确性.
主要方法:
- 介绍了基于对比性语言图像预训 (SDA-CLIP) 的外科领域适应.
- 使用视觉转换器 (ViT) 进行视频嵌入和转换器进行文本嵌入.
- 采用跨模式和内模式损失功能,以协调跨领域的嵌入.
- 在MICCAI 2020 EndoVis挑战 SurgVisDom数据集上进行评估.
主要成果:
- 在硬域适应任务 (仅VR数据) 中,SDA-CLIP获得了65.9%的加权F1分数.
- 在软域适应任务 (VR和临床类数据) 中获得了84.4%的加权F1分数.
- 在挑战中明显超过了表现最好的团队.
结论:
- SDA-CLIP有效地提取视频和文本信息,以改善跨域识别.
- 该方法在将模拟的外科数据适应临床应用方面表现出高性能.
- 开发的模型为增强自主手术系统提供了一个有前途的方法.


