通过空间解,在任意的特征级别进行排列:朝着选择性图像翻译
概括
本研究引入了一个新的无监督选择性图像翻译 (SLIT) 框架. 它有效地解开视觉特征,以精确编辑感兴趣的内容,而不改变不相关的部分,优于现有方法.
科学领域:
- 计算机视觉 计算机视觉
- 机器学习 机器学习
- 人工智能的人工智能
背景情况:
- 图像翻译旨在编辑全球风格,但选择性图像翻译 (SLIT) 处理编辑特定感兴趣的内容 (CoIs).
- 现有的SLIT方法经常失败,因为假设CoI是可分离的,忽视了纠的深度神经网络 (DNN) 表示,导致效率低下和不必要的变化.
研究的目的:
- 为选择性图像翻译 (SLIT) 开发一个新的无监督框架.
- 通过解开视觉特征来解决现有方法的局限性,以便更精确地操纵内容.
主要方法:
- 该框架采用信息理论方法,使用两个对立的力量来解开视觉特征.
- 一种力量促进空间独立,而其他形式则具有用于联合表征的块.
- 这种解适用于任何层的特征,可以在任意水平上进行变换.
主要成果:
- 拟议的方法有效地解开视觉特征,允许精确操纵感兴趣的内容 (CoIs).
- 该方法在选择性图像翻译任务中比最先进的基线显著改进.
- 该框架能够在任意的特征级别上应用解,这提供了一个显著的优势.
结论:
- 新的框架为无监督选择性图像翻译 (SLIT) 提供了有效的解决方案.
- 通过解开视觉特征,该方法可以精确控制图像编辑,保留不相关的内容.
- 这种方法通过灵活和高效地操纵特定图像区域来推动该领域的发展.


