走向视觉提示时间答案,以教学视频为基础
概括
本研究引入了一种新的视觉提示文本跨度本地化方法,以改善教学视频 (TAGV) 中的时间答案接地. 该方法通过整合视频字幕和视觉提示来增强视觉答案的定位,优于现有的方法.
科学领域:
- 计算机科学 计算机科学
- 人工智能的人工智能
- 视频分析 视频分析
背景情况:
- 在教学视频 (TAGV) 中的时间答案接地对于视频理解至关重要.
- 现有的方法在TAGV中与文本问题和视觉答案之间的弱相关性作斗争.
- 目前基于视觉跨度的预测器不足以准确的TAGV.
研究的目的:
- 为TAGV提出一种新的视觉提示文本间隔定位 (VPTSL) 方法.
- 在教学视频中,改进文字查询和视觉答案之间的语义理解.
- 将TAGV重新设计为一个由视觉提示增强的字幕跨度本地化任务.
主要方法:
- 开发了一种VPTSL方法,包括时间标记的字幕和可学习的视觉提示嵌入.
- 利用预先训练的语言模型,从文本,字幕和视觉提示中学习联合语义表示.
- 重构TAGV作为定位对应视觉答案的字幕跨度.
主要成果:
- 在五个基准数据集 (MedVidQA,TutorialVQA,VehicleVQA,CrossTalk,Coin) 上,VPTSL方法显著优于最先进的方法.
- 在欧盟 (mIoU) 的平均交叉点得分方面取得了实质性的改进.
- 证明了视觉提示符和基于文本跨度的预测器集成的有效性.
结论:
- 拟议的VPTSL方法提供了一种更有效的方法,以教学视频为时间答案的基础.
- 整合视觉提示和字幕信息增强了模型在视觉上接地答案的能力.
- 这项工作推动了教学视频分析和问答领域的发展.
更多相关视频
05:58Using Rapid Serial Visual Presentation to Measure Set-Specific Capture, a Consequence of Distraction While Multitasking
Published on: August 29, 2018
8.9K
09:27Using Eye Movements Recorded in the Visual World Paradigm to Explore the Online Processing of Spoken Language
Published on: October 13, 2018
10.0K
