对文本到图像生成模型的统一快速攻击
概括
我们开发了UPAM,这是一个新的框架,用于测试文本到图像 (T2I) 模型对有害内容生成的安全性. UPAM有效地绕过防御,使用新的学习技术进行强大的T2I模型评估.
科学领域:
- 人工智能的人工智能
- 计算机视觉 计算机视觉
- 网络安全 网络安全
背景情况:
- 文本到图像 (T2I) 模型存在由于可能产生有害内容的安全风险.
- 现有的防御通常集中在狭的文本方面,留下漏洞.
- 评估T2I模型对复杂攻击的稳定性至关重要.
研究的目的:
- 提出UPAM,这是一个统一的框架,用于从攻击角度评估T2I模型的稳定性.
- 在T2I模型中开发绕过文本和视觉防御的方法.
- 提高对T2I系统的敌对攻击的有效性,效率和隐蔽性.
主要方法:
- UPAM统一了对文本和视觉防御的攻击,使用基于梯度的优化.
- 球体检测学习 (SPL) 即使在图像输出被屏蔽时,也可以实现优化.
- 语义增强学习 (SEL) 和上下文自然增强 (INE) 确保语义控制和即时自然.
- 可转移的攻击学习 (TAL) 能够以最少的查询进行有效的攻击.
主要成果:
- UPAM在绕过T2I模型防御以生成有害内容方面表现出卓越的有效性.
- 该框架在对抗性提示中实现了高效率和自然性.
- 使用UPAM生成的攻击由于查询量最小,其检测率较低.
- 广泛的实验验证了该框架在以前的方法上的优越性.
结论:
- UPAM提供了一种强大而全面的方法来评估T2I模型的安全性.
- 提出的方法显著提高了识别和减轻T2I系统漏洞的能力.
- UPAM对于确保安全部署越来越强大的T2I技术至关重要.


