DCLTV:一个改进的双条件扩散模型,用于激光可见图像翻译
Xiaoyu Zhang1, Laixian Zhang2,3, Huichao Guo2,3
1Graduate School, Space Engineering University, Beijing 101416, China.
Sensors (Basel, Switzerland)
|February 13, 2025
概括
本研究介绍了DCLTV,这是一种新的双条件控制扩散模型,用于将激光图像转换为可见图像. DCLTV克服了现有方法的局限性,在交叉模式翻译中实现了卓越的图像质量和准确性.
科学领域:
- 计算机视觉 计算机视觉
- 图像处理 图像处理
- 人工智能的人工智能
背景情况:
- 激光主动成像在困难条件下提供清晰的图像,与可见光系统不同.
- 激光图像具有模态差异,妨碍感知和处理,需要交叉模态翻译.
- 现有的翻译方法在训练复杂性和颜色出血方面扎.
研究的目的:
- 开发一种先进的扩散模型,用于精确的激光到可见图像翻译.
- 为了解决当前交叉模式图像转换算法的局限性.
- 为了改善人类的感知和计算机处理激光成像数据.
主要方法:
- 设计了DCLTV,这是一个改进的扩散模型,具有双条件控制.
- 整合了布朗的桥梁策略来控制第一个条件.
- 在第二个条件控制中使用了基于插值的条件注射.
- 创建了一个由665个激光可见图像对组成的新数据集.
主要成果:
- DCLTV的表现超过了五个基线模型 (Pix2pix,BigColor,CT2,ColorFormer,DDColor).
- 在Fréchet Inception Distance (FID) 中至少减少了15.89%,在LPIPS (学习感知图像补丁相似性) 中减少了22.02%.
- 废弃实验证实了双重条件的有效性,产生FID的154.74和LPIPS的0.379.
结论:
- DCLTV在激光到可见图像翻译方面表现出卓越的性能.
- 双条件控制机制有效地提高了翻译准确性和图像质量.
- 开发的数据集解决了在这个专门的成像领域的数据稀缺问题.


