基于视觉语言模型的作物疾病的少数镜头图像分类
Yueyue Zhou1,2, Hongping Yan1, Kun Ding2
1School of Information Engineering, China University of Geosciences, Beijing 100083, China.
Sensors (Basel, Switzerland)
|September 28, 2024
概括
本研究引入了一种使用视觉语言模型 (VLMs) 进行作物疾病分类的新方法. 我们的方法通过利用多模式协同效应来加强农业监测,提高了少数拍摄场景的准确性.
科学领域:
- 农业科学 农业科学
- 计算机视觉 计算机视觉
- 人工智能的人工智能
背景情况:
- 准确的作物疾病分类对于粮食安全和农业生产率至关重要.
- 当前的方法通常依赖于单个图像类型和广泛的数据集,限制了它们的实际应用.
- 现有的单模式方法面临着数据稀缺和复杂疾病识别的挑战.
研究的目的:
- 开发一种有效的作物疾病分类方法,克服数据限制并提高准确性.
- 与传统的单模式技术相比,增强多模式协同效应,以更好地识别农作物疾病.
- 为农业病理学和智能农业监测提供一个务实的工具.
主要方法:
- 使用预先训练的视觉语言模型 (VLMs) 进行多模式作物疾病分类.
- 使用Qwen-VL从聚类疾病图像中生成详细的文本描述,以便快速生成文本.
- 集成交叉注意力和SE (挤压和激发) 注意力进入训练免费 (VLCD) 和训练要求 (VLCD-T) 模式,以增强分类器重量.
主要成果:
- 在少数射击作物疾病场景中显著提高了分类效率.
- 采用VLM生成提示的多式联络方法,超过了传统的单式联络方法.
- 通过捕获细粒度,图像特定的信息来提高快速质量.
结论:
- 提出的基于VLM的方法有效地解决了作物疾病分类中的数据限制.
- 这种方法为农业病理和智能农业提供了强大的解决方案.
- 该研究加强了多式联运人工智能的潜力,提高了农业监测和生产力.


