对象稳定无监督的双对比学习图像对图像翻译与查询选择注意力和卷积块注意力模块
Yunseok Oh1,2, Seonhye Oh1,3, Sangwoo Noh4
1Department of AI Convergence Engineering, Gyeongsang National University, Jinju-si, Gyeongsangnam-do, Republic of Korea.
PloS one
|November 6, 2023
概括
本研究引入了一种新的对象稳定双对比学习框架 (OS-DCLGAN),用于无监督的图像到图像翻译. 它通过完善特征提取来改进以前的方法,从而实现更有效的翻译.
科学领域:
- 计算机视觉 计算机视觉
- 机器学习 机器学习
- 人工智能的人工智能
背景情况:
- 对比式学习对于无监督图像对图像 (I2I) 翻译越来越受欢迎.
- 以前的查询选择注意 (QS-Attn) 模块专注于最大限度地提高相互信息,但由于选择具有相似意义的查询,经常过度强调背景元素.
- 这种限制阻碍了突出物体的精确翻译.
研究的目的:
- 提出一种新的双重学习框架,即对象稳定的双重对比学习生成对抗网络 (OS-DCLGAN),以解决现有的无监督I2I翻译方法的局限性.
- 加强对重要领域特定信息的关注,以提高翻译质量.
- 通过有效强调或抑制它们来完善中间特征.
主要方法:
- 引入了一个双学习框架,将QS-Attn与卷积块注意模块 (CBAM) 集成在一起.
- 在QS-Attn模块之前集成CBAM,以改进中间特征并捕获重要的域信息.
- 利用CBAM学习强调和抑制功能改进的能力.
主要成果:
- 拟议的OS-DCLGAN框架在各种I2I翻译任务中,与最近的方法相比,表现优越.
- 集成CBAM有效地改进了功能,从而提高了翻译准确性和对象稳定性.
- 该框架在不同的I2I翻译场景中显示出显著的有效性和多功能性.
结论:
- 通过改善特征表示,OS-DCLGAN框架为无监督的图像到图像翻译提供了有效的解决方案.
- 拟议的方法成功地克服了之前的QS-Attn模块中出现的背景过度强调问题.
- 该框架的增强性能突显了其在各种需要精确图像翻译的计算机视觉应用中的潜力.
相关概念视频
Improving Translational Accuracy
2.6K
2.6K
Vision
53.5K
Vision is the result of light being detected and transduced into neural signals by the retina of the eye. This information is then further analyzed and interpreted by the brain. First, light enters the front of the eye and is focused by the cornea and lens onto the retina—a thin sheet of neural tissue lining the back of the eye. Because of refraction through the convex lens of the eye, images are projected onto the retina upside-down and reversed.
53.5K


