多模式半监督学习,用于在线识别多细分化手术工作流程
Yutaro Yamada1, Jacinto Colan2, Ana Davila3
1Department of Micro-Nano Mechanical Science and Engineering, Nagoya University, Furo-cho, Chikusa-ku, Nagoya, Aichi, 464-8603, Japan. yamada@robo.mein.nagoya-u.ac.jp.
概括
本研究引入了一种新的半监督学习方法,用于使用多式联络数据进行手术工作流程识别. 该方法有效地从视频和动态数据中学习表示,提高准确性并减少注释需求.
科学领域:
- 计算机科学 计算机科学
- 医疗信息学 医疗信息学
- 机器人技术 机器人技术 机器人技术
背景情况:
- 手术工作流程的识别对于手术室的效率和安全至关重要.
- 当前的方法往往需要大量的标记数据,并专注于单一的任务或模式.
- 局限性包括高的注释成本和在各种手术过程中缺乏概括性.
研究的目的:
- 开发一种新的半监督学习方法,用于手术工作流程识别.
- 为了利用多式联络数据 (视频和动力学) 和自我监督,实现强大的表示学习.
- 为了提高注释的效率,同时在识别外科手势,阶段和步骤方面保持高性能.
主要方法:
- 采用了两阶段的代表性学习过程.
- 阶段1:从视频中提取无监督的时空视觉特征的时间对比学习.
- 第二阶段:视觉和动态特征的多式变异自编码器 (VAE) 融合,随后是用于在线识别的循环神经网络.
主要成果:
- 拟议的方法在JIGSAWS和MISAW数据集上实现了与完全监督模型相比或优于完全监督模型的性能.
- 在JIGSAWS Suturing数据集中,手势识别的准确性达到了83.3%.
- 该模型保持了高性能,并显著减少了注释要求 (标签一半),证明了增强的注释效率.
结论:
- 开发的多模式表示是多功能且在各种手术任务中有效的.
- 这种方法显著提高了手术工作流识别模型的注释效率.
- 这些发现对在手术环境中推进实时决策系统具有重大意义.


