关于计算机视觉中的图形神经网络和图形变压器的调查:以任务为导向的视角
IEEE transactions on pattern analysis and machine intelligence
|August 19, 2024
概括
本综述探讨了计算机视觉中的图形神经网络 (GNN) 和图形变压器. 它根据输入数据模式和视觉任务对他们的应用进行了分类,提供了洞察力和未来方向.
科学领域:
- 计算机视觉 计算机视觉
- 图形表示学习学习学习图形表示学习
- 深度学习 (Deep Learning) 是一种深度学习.
背景情况:
- 图形神经网络 (GNN) 在图形表示学习方面表现出色,推进了数据挖掘,计算机视觉和NLP等领域.
- 图形变压器将图形结构集成到变压器架构中,解决局部聚合和刚性感应偏差的局限性.
研究的目的:
- 提供关于计算机视觉中的图形神经网络 (GNN) 和图形转换器的全面审查.
- 从面向任务的角度检查应用程序,按输入数据模式和特定视觉任务分类.
主要方法:
- 将计算机视觉中的GNN和图形转换器应用分为五种输入数据模式:2D图像,视频,3D数据,视觉+语言和医疗图像.
- 进一步将每个类别内的应用程序按特定的视觉任务进行细分.
- 分析任务定义,挑战,代表性方法,见解,局限性和未来研究方向.
主要成果:
- 基于输入数据和任务的计算机视觉中的GNN和图形变压器应用程序的结构化分类.
- 对各种计算机视觉任务的代表性基于GNN和图形转换器方法进行了深入的覆盖.
- 讨论这些基于图形的模型在计算机视觉中的性能,局限性和未来潜力.
结论:
- 图形神经网络和图形变压器为各种计算机视觉任务提供了强大的工具.
- 一个以任务为导向,模式为特定的审查提供了对当前能力和未来研究途径有价值的见解.
- 这篇论文是理解和推进计算机视觉中的基于图形的方法的全面资源.


