CIPS-3D++:用于GAN倒置和造型的端到端实时高分辨率3D感知GAN
概括
CIPS-3D++增强了3D意识的生成对抗网络 (GANs),用于高分辨率的图像合成和编辑. 这种强大而高效的模型实现了最先进的结果,可以精确控制摄像头姿势和3D重建.
科学领域:
- 计算机视觉 计算机视觉
- 人工智能的人工智能
- 深度学习 (Deep Learning) 是一种深度学习.
背景情况:
- 基于风格的生成对抗网络 (GAN) 在图像生成方面表现出色,但缺乏对摄像头姿势的明确控制.
- 基于NeRF的GAN在3D感知图像生成方面取得了进展,但往往遭受旋转非不变性和计算效率低下的问题.
- 现有的方法在稳定性,图像质量和高计算成本方面扎,阻碍了实际应用.
研究的目的:
- 开发一个高强度,高分辨率和计算效率高的3D感知GAN.
- 为了能够精确地控制相机姿势,并促进3D意识的图像编辑和合成.
- 为推进3D感知生成模型建立一个多功能平台.
主要方法:
- 推出了CIPS-3D,一种基于风格的GAN,具有浅层的基于NeRF的3D形状编码器和基于MLP的深度2D图像解码器,用于旋转不变生成.
- 开发CIPS-3D++,结合几何规范化和升级样本,以提高高分辨率图像合成和编辑效率.
- 实现了NeRF网络的辅助区分器,以解决培训期间的镜像对称性问题.
主要成果:
- CIPS-3D++实现了最先进的3D感知图像合成,在FFHQ上达到3.2的FID分数,分辨率为1024x1024.
- 该模型在低GPU内存足迹下显示了高计算效率,允许对高分辨率图像进行端到端训练.
- 介绍了FlipInversion,3D意识的GAN倒置算法,用于单视图3D对象重建和3D意识的造型.
结论:
- CIPS-3D++显著提升了对3D意识的GAN,提供了前所未有的稳定性,分辨率和效率.
- 该模型为将2D图像编辑技术转移到3D领域提供了一个强大的基础.
- CIPS-3D++ 便于创新应用,包括从单个图像进行3D重建和风格化.


