通过视觉语言模型增强废物识别:为可扩展的解决方案提供快速工程方法
Hiranya Jeet Malla1, Milad Bazli2, Mehrdad Arashpour1
1Department of Civil Engineering, Monash University, Melbourne, VIC 3800, Australia.
Waste management (New York, N.Y.)
|June 13, 2025
概括
视觉语言模型 (VLMs) 为废物图像分类提供了可扩展的解决方案,优于传统方法. 有针对性的提示工程显著提高了VLM的准确性,即使在数据稀缺的场景.
科学领域:
- 计算机视觉 计算机视觉
- 人工智能的人工智能
- 废物管理 废物管理
背景情况:
- 传统的计算机视觉模型在材料回收设施中与各种废物图像作斗争.
- 频繁的微调和数据增强是资源密集的,对于可扩展的废物分类来说是不可持续的.
研究的目的:
- 实施和评估用于废物图像分类的最先进的视觉语言模型 (VLM).
- 探索VLM在数据稀缺环境中的适应性,使用零射击,少数射击和完全监督的学习.
- 调查快速工程对VLM性能的影响.
主要方法:
- 使用视觉语言模型 (VLMs) 的多式模式图像分类.
- 评估了零射击,少数射击和完全监督的学习能力.
- 雇员针对性提示工程,以优化VLM性能.
- 基于准确性和推断速度权衡的评估模型.
主要成果:
- 零射击废物图像分类准确度通过快速工程从82.71%提高到90.48%.
- 完全监督的分类准确度达到97.18%的最佳VLM.
- 在数据稀缺的情况下,VLMs表现出了适应能力和可扩展性.
结论:
- 视觉语言模型为废物图像分类提供了一个有希望的,可扩展的解决方案.
- 有针对性的提示工程是提高废物管理应用中的VLM性能的有效策略.
- 这项研究通过人工智能驱动的图像分类来推进废物管理.


