NNG-Mix:通过伪异常生成改进半监督异常检测
概括
本研究介绍了近邻高斯混合 (NNG-Mix),这是一个用于异常检测 (AD) 的新算法. NNG-Mix从有限的标记数据中生成有效的伪异常,在各种数据集中显著提高了AD性能.
科学领域:
- 计算机科学 计算机科学
- 人工智能的人工智能
- 机器学习 机器学习
背景情况:
- 异常检测 (AD) 对于识别复杂系统中的罕见事件至关重要.
- 由于标签成本高,AD通常不受监督,但半监督的方法从有限的专家标签数据中受益.
- 现有的增强技术可能无法最佳地利用有限的标记异常.
研究的目的:
- 介绍一种新的算法,即近邻高斯混合 (NNG-Mix),用于生成伪异常.
- 通过增加有限的标记异常数据来增强半监督和监督异常检测.
- 通过有效的数据增强,提高异常检测系统的性能.
主要方法:
- 开发了近邻高斯混合 (NNG-Mix) 算法.
- NNG-Mix集成了标记和未标记的数据,以产生伪异常.
- 通过在增强数据集上训练现有的AD算法并与Mixup和Cutout进行比较来评估NNG-Mix.
主要成果:
- NNG-Mix显著优于常见的增强技术,如混合和切割.
- 在57个ADBench数据集上的实验表明,与基线方法相比,性能有了显著的改善.
- 在ADBench中,在古典学上取得了高达16.4%的改进,在CV上达到8.8%,在NLP数据集上达到8.0%.
结论:
- NNG-Mix是一种有效的数据增强方法,用于半监督和监督异常检测.
- 该算法成功生成了有价值的伪异常,提高了AD模型的性能.
- NNG-Mix提供了一种实际的解决方案,可以在有限的标记数据下改善异常检测.


