一种基于视觉语言模型的交通标志检测方法,用于高分辨率无人机图像:中国贵阳的一个案例研究
Jianqun Yao1, Jinming Li1, Yuxuan Li1
1CCCC Infrastructure Maintenance Group Co., Ltd., Beijing 100011, China.
Sensors (Basel, Switzerland)
|September 14, 2024
概括
本研究介绍了视觉语言模型 (VLMs),用于使用无人机图像进行高效的交通标志检测. 这种方法消除了对手册注释的需求,大大减少了培训成本和时间.
科学领域:
- 计算机视觉 计算机视觉
- 人工智能的人工智能
- 运输工程 运输工程
背景情况:
- 交通标志对于运输系统至关重要,无人机越来越多地用于监控.
- 当前的交通标志检测方法严重依赖于耗时的图像注释.
- 开发大型,多样化的数据集用于交通标志监控是一个重大挑战.
研究的目的:
- 探索视觉语言模型 (VLMs) 用于使用无人机图像检测交通标志的应用.
- 开发一种方法,可以绕过对离散图像标签的需求,从而实现快速部署.
- 为了减少与为交通标志监控创建注释数据集相关的成本和时间.
主要方法:
- 编制了交通标志的关键词词典,结合了中国国家形状和颜色标准.
- 使用引导语言图像预训 v2 (BLIPv2) 来从代表图像生成文本描述.
- 采用了对比性语言图像预训练 (CLIP) 框架来描述无人机图像和文本描述.
- 预测的交通标志类别基于视觉特征和词语嵌入的相似性,使用共弦距离和软max.
主要成果:
- 拟议的基于VLM的方法在实际应用中使用来自中国贵阳的无人机图像证明了可接受的预测准确性.
- 在两个公共数据集上的实验证实了该方法的有效性.
- 与传统的注释依赖方法相比,这种方法实现了较低的培训成本.
结论:
- 视觉语言模型提供了一种可行和高效的替代方案,用于从无人机图像中检测交通标志.
- 开发的方法显著减少了对手工注释的依赖,降低了数据集创建成本.
- 这种方法有望在交通标志监控系统中实现可扩展和快速部署.


