相关实验视频
Updated: Sep 16, 2025

13:51
Cross-Modal Multivariate Pattern Analysis
Published on: November 9, 2011
20.1K
RGB-FIR多模式行人检测与跨模式上下文注意模型
Han Wang1, Lei Jin1, Guangcheng Wang1
1School of Transportation and Civil Engineering, Nantong University, Nantong 226019, China.
Sensors (Basel, Switzerland)
|July 12, 2025
概括
这项研究引入了一个新的多式联运YOLO模型,使用RGB和FIR图像来更好地检测行人. 新的跨模式上下文注意模型 (CCAM) 改进了功能融合,以提高自动驾驶的准确性和稳定性.
科学领域:
- 计算机视觉 计算机视觉
- 自主驾驶系统 自主驾驶系统
- 机器学习 机器学习
背景情况:
- 对于视觉认知和自动驾驶,行人检测至关重要.
- 现有的多式联运YOLO模型专注于后端融合,可能缺少前端功能提取优化.
- 目前的方法忽视了RGB和FIR模式之间的互补性,以及不同特征尺度之间的互补性.
研究的目的:
- 提出一个新的RGB-FIR多式联网骨干网络框架,使用跨模式上下文注意模型 (CCAM).
- 通过优化前端和后端阶段的功能融合来增强行人检测.
- 提高行人检测系统的准确性和稳定性.
主要方法:
- 开发了一个多层次的融合框架,在并行RGB-FIR骨干网络的前端结合了CCAM.
- 利用低层特征融合来优化高层特征的空间重量,从而实现跨模式和跨尺度的互补性.
- 结合通道空间联合注意力 (CBAM) 和后端的自我注意力模型用于最终特征融合.
主要成果:
- 在多个RGB-FIR公共数据集上的比较实验表明,在行人检测方面有显著的改进.
- 拟议的基于CCAM的框架在准确性和稳定性方面超过了当前的RGB-FIR多式联络YOLO模型.
- 该方法通过跨模式和跨规模优化有效地提高了原始特征的表示能力.
结论:
- 新的RGB-FIR多式联网骨干网络与CCAM为行人检测提供了一种优越的方法.
- 该框架通过将前端特征提取与先进的聚变技术相结合来解决现有方法的局限性.
- 这些发现有助于在自动驾驶应用中更可靠的行人检测系统.

