大型视觉语言模型的资源效率微调,用于自动挖掘机中的多模式感知
Hung Viet Nguyen1, Hyojin Park2, Namhyun Yoo3
1Department of Digital Anti-aging Healthcare, INJE University, Kimhae, Republic of Korea.
Frontiers in artificial intelligence
|December 4, 2025
概括
本研究介绍了一种有效的方法,用于为自动挖掘机微调大型视觉语言模型 (LVLMs). 该方法增强了在标准硬件上的人/障碍物检测和天气分类.
科学领域:
- 计算机视觉 计算机视觉
- 人工智能的人工智能
- 机器人技术 机器人技术 机器人技术
背景情况:
- 大视觉语言模型 (LVLMs) 提供了先进的多式联络理解,但在构建中未得到充分探索.
- 现实世界的自动挖掘机操作需要强大的视觉识别,以确保安全和效率.
研究的目的:
- 为自动挖掘机任务微调LVLM开发资源高效的框架.
- 为了能够对人类和障碍物进行强有力的检测,并在消费级硬件上准确地进行天气分类.
主要方法:
- 杆定量低级调整 (QLoRA) 和Unsloth框架,以实现高效的LVLM微调.
- 在一个特定域的挖掘机视觉数据集上评估了五个开源的LVLM (Llama-3.2-Vision,Qwen2-VL,Qwen2.5-VL,LLaVA-1.6,Gemma 3).
- 在1000个注释上微调模型,并在2000张图像上进行测试.
主要成果:
- 在评估的LVLM中,在物体检测和天气分类方面取得了显著的改进.
- Qwen2-VL-7B表现出卓越的性能,mAP@50为88.03%,准确率为84.54%.
- 精心调整的Qwen2-VL-7B模型可稳定检测人类/障碍物,并对天气进行分类.
结论:
- 拟议的框架允许对消费者硬件上的自动挖掘机操作进行高效的LVLM微调.
- 基于LVLM的多式联动人工智能代理可用于提高建筑环境中的安全,监控和规划.
- 这项研究为在重型机械自动化领域的先进AI应用铺平了道路.

