TIER-LOC:基于视觉查询的视频片段定位在胎儿超声视频中,使用多层变压器
Divyanshu Mishra1, Pramit Saha1, He Zhao2
1Institute of Biomedical Engineering, Department of Engineering Science, University of Oxford, Oxford, OX3 7DQ, United Kingdom.
Medical image analysis
|May 9, 2025
概括
我们为医疗视频推出基于视觉查询的视频片段本地化 (VQ-VCL). 我们的TIER-LOC模型通过使用多层功能来改善检索,高达7%的超越现有方法.
科学领域:
- 医学成像和视频分析.
- 计算机视觉 计算机视觉
- 机器学习 机器学习
背景情况:
- 在医疗视频中精确地定位特定事件对于诊断和工作流效率至关重要.
- 现有的方法在医疗视频数据中常见的细微细节,尺度变化和注释噪声方面扎.
研究的目的:
- 介绍一种基于视觉查询的视频片段本地化 (VQ-VCL) 任务,以提高医疗视频的理解.
- 提出TIER-LOC模型,旨在通过多层特征提取来改进视频片段的检索.
- 为了应对视频数据中微妙的差异,尺度变化和杂的注释等挑战.
主要方法:
- 开发了TIER-LOC,一种采用多层空间时间变压器用于化特征提取的模型.
- 使用多层,双对比损失来减轻注释噪声和提高稳定性.
- 实施了时间不确定性意识定位损失,以减少对不精确事件边界的敏感性.
主要成果:
- TIER-LOC在两个超声波视频数据集和一个自我中心视频数据集上表现出卓越的性能.
- 在各自的数据集上,与最先进的模型相比,实现了7%,4%和4%的性能改进.
- 成功应用于超声波器工作流程辅助,用于胎儿超声波分析和异常检测.
结论:
- TIER-LOC模型显著推进了基于视觉查询的视频剪辑本地化,特别是在细粒度的医疗视频中.
- 拟议的多层特征方法和新的损失函数有效地处理现实世界的视频复杂性.
- 这项工作为改善医疗视频分析和临床决策提供了有前途的工具.


