Video Experimental Relacionado
Updated: May 5, 2026

Advanced Diffusion Imaging in The Hippocampus of Rats with Mild Traumatic Brain Injury
Published on: August 14, 2019
Ataque discriminatorio adversarial a modelos de difusión de texto a imagen
Hanxiao Wu1, Shengwu Xiong2, Dong Yi3
1School of Computer Science and Artificial Intelligence, Wuhan University of Technology, Wuhan, 430070, Hubei, China; Institute of Automation, Chinese Academy of Sciences, Beijing, 100190, China; School of Artificial Intelligence, University of Chinese Academy of Sciences, Beijing, 101408, China; Wuhan AI Research, Wuhan, 430000, Hubei, China.
Un nuevo método de ataque, el Ataque Discriminatorio Adversarial (ADAtk), elude eficazmente los mecanismos de seguridad en modelos de difusión con conceptos borrados. ADAtk genera imágenes clasificadas como No Seguras Para el Trabajo (NSFW) con más del 90 % de éxito, revelando vulnerabilidades en las técnicas actuales de seguridad de IA.
Área de la Ciencia:
- Inteligencia Artificial
- Visión por Computadora
- Modelos Generativos
Sus antecedentes:
- Los modelos de difusión con conceptos borrados enfrentan desafíos para prevenir la generación de contenido No Seguro Para el Trabajo (NSFW).
- Los métodos de ataque existentes se centran en la similitud de imágenes, lo que no garantiza la reconstrucción exitosa de NSFW.
Objetivo del estudio:
- Proponer un método de ataque novedoso, el Ataque Discriminatorio Adversarial (ADAtk), para exponer vulnerabilidades en modelos de difusión con conceptos borrados.
- Abordar las limitaciones de los ataques existentes centrados en la generación adoptando un enfoque discriminatorio.
Principales métodos:
- ADAtk optimiza la probabilidad de generar contenido NSFW creando perturbaciones adversarias en el espacio latente del modelo.
- El método guía la reconstrucción de imágenes hacia una clase discriminatoria objetivo, con el objetivo de clasificarla como inapropiada.
Principales resultados:
- ADAtk logró una tasa de éxito superior al 90 % en la elusión de los mecanismos de seguridad internos actuales.
- El ataque expuso con éxito limitaciones críticas en las técnicas existentes de borrado de conceptos para modelos de difusión.
Conclusiones:
- ADAtk proporciona información crucial para mejorar la seguridad y la confiabilidad de los sistemas de generación de texto a imagen.
- Los hallazgos allanan el camino para el desarrollo de modelos de IA generativa más seguros y protocolos de seguridad robustos.