Ataque discriminatorio adversarial a modelos de difusión de texto a imagen

Hanxiao Wu1, Shengwu Xiong2, Dong Yi3

  • 1School of Computer Science and Artificial Intelligence, Wuhan University of Technology, Wuhan, 430070, Hubei, China; Institute of Automation, Chinese Academy of Sciences, Beijing, 100190, China; School of Artificial Intelligence, University of Chinese Academy of Sciences, Beijing, 101408, China; Wuhan AI Research, Wuhan, 430000, Hubei, China.

Resumen

Un nuevo método de ataque, el Ataque Discriminatorio Adversarial (ADAtk), elude eficazmente los mecanismos de seguridad en modelos de difusión con conceptos borrados. ADAtk genera imágenes clasificadas como No Seguras Para el Trabajo (NSFW) con más del 90 % de éxito, revelando vulnerabilidades en las técnicas actuales de seguridad de IA.