自我增强的混合注意网络用于三模图像的少数镜头语义细分
Kechen Song1, Yiming Zhang1, Yanqi Bao2
1School of Mechanical Engineering & Automation, Northeastern University, Shenyang 110819, China.
Sensors (Basel, Switzerland)
|July 29, 2023
概括
这项研究引入了一种新的三模 (可见-深度-热) 图像方法,用于少数镜头的语义细分,改善低光条件下的性能. 自强化混合注意网络 (SEMANet) 通过有限的注释数据实现了最先进的结果.
科学领域:
- 计算机视觉 计算机视觉
- 机器学习 机器学习
- 图像处理 图像处理
背景情况:
- 图像细分至关重要,但在照明不佳的情况下却很难实现.
- 多模式成像和少数拍摄学习为数据稀缺和具有挑战性的条件提供了解决方案.
- 现有的方法在极端低光场景中缺乏稳定性.
研究的目的:
- 提出一种使用可见-深度-热 (三模) 图像的新短拍语义细分方法.
- 解决图像分割模型在低照明环境中的性能下降问题.
- 引入一个新的数据集和一个强大的网络架构,以改善几次拍摄的细分.
主要方法:
- 开发了一个可见深度热 (三模) 图像数据集 (VDT-2048-5i) 用于少数镜头的语义细分.
- 提出了自我增强混合注意力网络 (SEMANet),其中包括自我增强 (SE) 和混合注意力 (MA) 模块.
- 从三模图像中利用同质和互补的信息来进行特征融合和增强.
主要成果:
- SEMANet实现了最先进的性能,改善了整个欧盟 (mIoU) 的平均交叉点3.8% (1次射击) 和3.3% (5次射击).
- 与现有的先进方法相比,拟议的方法在少数拍摄的细分任务中显示出更高的性能.
- SE模块增强了前景特征歧视,而MA模块有效地融合了多模式特征.
结论:
- 三种模式的可见-深度-热量方法与SEMANet相结合,显著推进了少数镜头的语义细分,特别是在具有挑战性的低光条件下.
- 新的数据集和网络架构为未来对强大的图像细分研究提供了坚实的基础.
- 未来的工作将集中在增强特征表示,以提高稳定性和降低计算成本.


