数据ID提取网络用于无监督的类和分类器免费检测对抗性示例
概括
这项研究引入了一种新的无监督方法来检测对抗性示例,这是操纵的输入,欺骗深度神经网络 (DNN). 该方法有效地识别恶意样本,而不需要先前了解攻击类型或数据类别.
科学领域:
- 人工智能的人工智能
- 机器学习 机器学习
- 计算机视觉 计算机视觉
背景情况:
- 深度神经网络 (DNN) 是强大的,但易受对抗的例子.
- 敌对攻击对DNN的可靠性构成重大威胁.
- 现有的检测方法通常需要标记数据或对攻击的了解.
研究的目的:
- 提出一种不受监督,没有类别和分类器的对抗性检测方法.
- 开发一个强大的探测器,不需要对对抗示例,类或原始分类器的先验知识.
- 加强深度学习模型的安全性和可靠性,以防止对手操纵.
主要方法:
- 开发了一个利用样本结构信息的对抗检测器,捕获残余信息和变量智能的结构关系.
- 引入了一个新的属性,数据标识 (ID),将提取的剩余和结构信息结合起来,用于对抗样本的识别.
- 训练检测器只使用未标记的清洁数据,使其广泛适用.
主要成果:
- 拟议的方法在检测CIFAR-10和ImageNet数据集的对抗性攻击方面取得了最先进的性能.
- 与现有的对抗性检测技术相比,展示了优越的检测能力.
- 可视化实验证实了结构信息在识别对抗性示例方面的有效性.
结论:
- 无监督,无类和分类器的方法为减轻对抗性威胁提供了一个非常有效的策略.
- 数据身份属性通过分析它们的结构性质,成功地区分了对抗性示例.
- 这种方法为构建更有弹性的深度学习系统提供了一个有希望的方向.


