一个微调的基础模型SurgiSAM2用于手术视频解剖细分和检测
Devanish N Kamtam1, Joseph B Shrager2,3, Satya Deepya Malla2
1Division of Thoracic Surgery, Department of Cardiothoracic Surgery, Stanford University School of Medicine, Stanford, CA, USA. devanish@stanford.edu.
Scientific reports
|October 15, 2025
概括
分段任何模型2 (SAM2) 在手术场景理解方面表现出强的表现. 微调SAM 2显著改善了手术视频中的器官和组织细分,优于之前的先进方法.
科学领域:
- 医疗图像分析 医学图像分析
- 计算机视觉 计算机视觉 计算机视觉
- 手术技术手术技术的使用.
背景情况:
- 基础的分段模型,如分段任何模型 (SAM) 和SAM 2提供先进的零射击功能.
- 了解手术场景需要精确对器官和组织进行细分.
研究的目的:
- 评估SAM 2在手术环境中对解剖组织的语义细分性能.
- 评估SAM 2微调对手术图像分割的影响.
- 将微调的SAM 2与最先进的 (SOTA) 方法进行比较.
主要方法:
- 利用了五个公共数据集来评估和微调SAM 2.
- 对SAM 2的图像编码器和面具解码器进行了微调.
- 研究了有限的培训数据 (50-400个样本/班级) 和提示点 (1-10) 的影响.
- 使用加权平均子系数 (WMDC) 评估的性能.
主要成果:
- 微调模型SurgiSAM 2实现了相对于基线SAM 2的17.9%的相对WMDC增长.
- 在10个提示点和400个样本/类时,达到最佳性能 (WMDC 0.92).
- 在80%的测试类 (WMDC 0.91) 和77.8%的看不见的器官类中,SurgiSAM 2超过了之前的SOTA方法.
- 严重剖析的组织和类似器官的细分仍然具有挑战性.
结论:
- 萨姆2在手术场景理解方面具有显著的潜力,无论是在零射击还是微调的场景中.
- 微调SAM 2提高了它在手术图像中对解剖结构进行细分的能力.
- 该模型对自动化注释管道充满希望,减少手工在外科应用中的精力.


