时空注意力和高斯过程,用于个性化视频凝视估计
Swati Jindal1, Mohit Yadav2, Roberto Manduchi1
1University of California Santa Cruz.
概括
这项研究引入了一种用于视频凝视估计的新型深度学习模型,通过空间注意力机制和个性化来提高准确性. 该方法增强了从面部视频中对人类注意力和行为的理解.
科学领域:
- 计算机视觉 计算机视觉
- 人工智能的人工智能
- 人与计算机的交互
背景情况:
- 凝视分析对于理解人类行为和注意力至关重要.
- 从面部视频中估计视线方向会带来诸如动态序列,静态背景和照明变化等挑战.
研究的目的:
- 开发一种新的深度学习模型,用于准确的视频凝视估计.
- 为了应对动态凝视跟踪,背景变化和照明变化的挑战.
- 将个性化纳入,以获得最少的数据来改进视线估计.
主要方法:
- 一个深度学习模型,包含一个空间注意模块来跟踪视频中的空间动态.
- 一个时间序列模型,将空间观测转化为时间洞察力,用于准确的目光预测.
- 整合高斯过程,以使用少数标记样本进行个体特定的个性化.
主要成果:
- 在Gaze360数据集上实现了最先进的性能,在没有个性化的情况下改进了2.5°.
- 通过仅使用三个样本进行个性化,进一步提高了0.8°的性能.
- 在数据集内部和跨数据集评估中都证明了有效性.
结论:
- 拟议的时空注意力模型显著提高了视频凝视估计的准确性.
- 用高斯过程进行个性化,可以在最小的数据中进行有效的模型调整.
- 该方法提供了一个强大的解决方案,用于从视频数据中分析人类的注意力和行为.


