Adversarial discriminant attack on text-to-image diffusion models

Hanxiao Wu1, Shengwu Xiong2, Dong Yi3

  • 1School of Computer Science and Artificial Intelligence, Wuhan University of Technology, Wuhan, 430070, Hubei, China; Institute of Automation, Chinese Academy of Sciences, Beijing, 100190, China; School of Artificial Intelligence, University of Chinese Academy of Sciences, Beijing, 101408, China; Wuhan AI Research, Wuhan, 430000, Hubei, China.

Summary

A new attack method, Adversarial Discriminant Attack (ADAtk), effectively bypasses safety mechanisms in concept-erased diffusion models. ADAtk generates images classified as Not-Safe-For-Work (NSFW) with over 90% success, revealing vulnerabilities in current AI safety techniques.