基于文本的基础模型的改编,用于几次手术的手术工作流分析
Tingxuan Chen1, Kun Yuan2,3,4, Vinkle Srivastav5,6
1CAMP, Technische Universität München, Munich, Germany. tingxuan.chen@tum.de.
概括
通过对齐图像和文本嵌入,Surg-FTDA (Few-shot Text-driven Adaptation) 能够使用最少的数据进行外科手术工作流分析. 这种以文本为导向的方法提高了效率和安全性,而不需要大型注释数据集.
科学领域:
- 医疗信息学 医疗信息学
- 计算机视觉 计算机视觉
- 外科手术工作流程分析
背景情况:
- 手术工作流分析对于提高手术效率和患者安全至关重要.
- 现有的方法通常需要大型,专业注释的数据集,这些数据集昂贵且难以扩展.
- 需要方法来减少对大量注释数据的依赖.
研究的目的:
- 引入Surg-FTDA (Few-shot Text-driven Adaptation),这是一个用于外科手术工作流分析的新方法.
- 为了实现各种外科手术工作流分析任务,使用最小的配对图像标签数据.
- 克服外科研究中大规模注释数据集的局限性.
主要方法:
- 基于少数镜头选择的模式对齐,以弥合图像和文本嵌入之间的差距.
- 文本驱动的适应,仅使用文本数据来训练解码器,消除对图像文本数据配对的需求.
- 在与图像相关的任务中,将训练有素的解码器应用于对齐的图像嵌入.
主要成果:
- Surg-FTDA在生成 (图像标题) 和区分 (三重和阶段识别) 任务中表现出强的表现.
- 该方法在不同的下游外科手术工作流分析任务中显示出有效的概括性.
- 结果表明优于现有的基线方法.
结论:
- 提出了一种以文本为导向的适应方法 (Surg-FTDA),以解决外科手术工作流分析中的模式差距.
- 这种方法显著减少了对大型注释数据集的需求.
- 这项研究促进了人工智能在手术分析中的更广泛应用,数据要求最小. 代码和数据集将会发布.


