个性化视觉语言模型与混合提示符进行零射击异常检测
IEEE transactions on cybernetics
|March 3, 2025
概括
本研究介绍了AnomalyVLM用于零射击异常检测,使用产品标准而不是参考图像. 通过利用视觉语言模型和混合提示,AnomalyVLM有效地检测新类别中的异常.
科学领域:
- 计算机视觉 计算机视觉
- 机器学习 机器学习
- 人工智能的人工智能
背景情况:
- 零射击异常检测 (ZSAD) 旨在使基础模型能够在没有参考图像的情况下检测各类异常.
- 在没有特定类别"正常"背景的情况下定义"异常"对ZSAD来说是一个重大挑战.
- 现有的方法通常需要大量的标记数据或参考图像,这限制了它们的适用性.
研究的目的:
- 提出AnomalyVLM,一种新的零射击异常检测方法,利用产品标准来定义正常和异常环境.
- 克服视觉语言模型 (VLM) 在解释异常检测标准中的复杂文本信息方面的局限性.
- 为了在任意类别中实现灵活和无数据的异常检测.
主要方法:
- 利用预先训练的通用视觉语言模型 (VLMs) 来解释产品标准.
- 从标准中生成"混合提示" (包括异常区域描述,符号规则和区域号码),以增强VLM理解.
- 将这些混合提示集成到异常检测阶段,特别是VLM中的异常区域发生器和精炼器.
- 在不需要训练数据的情况下,将VLM定制为特定类别的异常探测器.
主要成果:
- 在四个公共工业异常检测数据集上,AnomalyVLM展示了卓越的性能和增强的概括能力.
- 该方法在检测基于纹理的异常方面表现特别有效.
- 在实际的汽车零部件检查任务上的实验验证了该方法的现实应用性.
- 该系统允许用户控制和灵活定义和检测新类别中的异常.
结论:
- 通过使用产品标准,AnomalyVLM为基于参考图像的ZSAD提供了一个可行的替代方案.
- 混合提示显著提高VLM对有效异常检测标准的理解.
- 拟议的方法提供了一种灵活的,数据效率高的解决方案,用于跨多种新型类别的异常检测.
更多相关视频
06:15Using the Visual World Paradigm to Study Sentence Comprehension in Mandarin-Speaking Children with Autism
Published on: October 3, 2018
7.6K
07:12Development of a Gaze-Contingent Display Framework Designed for Perceptual and Oculomotor Research with Simulated Central Vision Loss
Published on: April 11, 2025
263
