NavBLIP:一种视觉语言模型,用于增强无人机导航和物体检测
Ye Li1, Li Yang1, Meifang Yang1
1Department of Electrical Engineering, Baotou Iron and Steel Vocational Technical College, Baotou, China.
Frontiers in neurorobotics
|February 10, 2025
概括
NavBLIP 通过使用多式联网数据来增强无人机导航和物体检测. 这种新的视觉语言模型在动态环境中提高了实时性能和适应性.
科学领域:
- 机器人和人工智能 机器人和人工智能
- 计算机视觉 计算机视觉
- 机器学习 机器学习
背景情况:
- 传统的无人飞行器 (UAV) 导航和物体检测方法与动态环境作斗争,缺乏稳定性和实时效率.
- 单模式深度学习和手工制作的功能限制了复杂场景中的适应性和概括性.
- 多式联运数据的有效集成对于先进的无人机能力至关重要.
研究的目的:
- 推出NavBLIP,一种用于增强无人机导航和物体检测的新型视觉语言模型.
- 利用多式联运数据提高无人机的稳定性和计算效率.
- 在动态和复杂的环境中解决现有方法的局限性.
主要方法:
- 开发了NavBLIP,这是一个视觉语言模型,利用转移学习和麻烦不变多式特征提取 (NIMFE) 模块.
- 该NIMFE模块将相关特征从复杂的视觉和环境输入中分离出来.
- 实施了多式联运控制策略,用于动态,特定于环境的特征选择,以优化实时性能.
主要成果:
- 在基准数据集 (RefCOCO,CC12M,OpenImages) 上,NavBLIP在准确性,回忆和计算效率方面表现优于最先进的模型.
- 废弃性研究证实了NIMFE和转移学习对绩效增长的重大贡献.
- 该模型显示了对需要适应性的实时无人机应用的巨大潜力.
结论:
- 通过多式联网数据集成,NavBLIP有效地增强了无人机导航和对象检测.
- NIMFE模块和转移学习是提高性能和适应能力的关键组成部分.
- 在不同的环境中,NavBLIP为实时,高效和强大的无人机操作提供了一个有前途的解决方案.


