增强的多尺度交叉注意力为人形象生成
概括
本研究介绍了XingGAN,这是一个用于生成人形象的新型生成对抗网络 (GAN). XingGAN利用交叉注意力机制来改善外观和形状合成,实现比扩散模型更快的训练和推断.
科学领域:
- 计算机视觉 计算机视觉
- 人工智能的人工智能
- 深度学习 (Deep Learning) 是一种深度学习.
背景情况:
- 生成对抗网络 (GAN) 广泛用于图像生成.
- 人形生成在合成现实的外观和形状方面提出了挑战.
- 现有的GAN往往难以有效地整合复杂的生成任务的多模式功能.
研究的目的:
- 提出一个新的基于交叉注意力的GAN,名为XingGAN,用于改进人形象生成.
- 增强外观和形状信息的融合,以实现更准确的合成.
- 开发一种计算效率高的方法,与基于扩散的模型性能竞争.
主要方法:
- 开发了XingGAN,在外观和形状上有两代分支.
- 引入了新的交叉注意力块,用于功能转移和嵌入更新.
- 实施了多级交叉注意力块,用于长距离的相关性学习.
- 提出了一个增强注意力 (EA) 模块来改进注意力权重.
- 集成了一个密集连接的共同注意模块,用于功能融合.
主要成果:
- 在个人图像生成方面,XingGAN优于现有的基于GAN的方法.
- 拟议的方法实现了与基于扩散的模型可比的性能.
- 与扩散模型相比,XingGAN表现出明显更快的训练和推理速度.
结论:
- 在XingGAN中,新的交叉注意力机制有效地改善了人形图像合成.
- XingGAN为扩散模型提供了一个引人注目的替代方案,平衡性能和效率.
- 这项工作推进了基于GAN的方法来处理复杂的图像生成任务.


