相关实验视频
Updated: Jan 8, 2026

04:48
Swin-PSAxialNet: An Efficient Multi-Organ Segmentation Technique
Published on: July 5, 2024
723
走向统一的语义和可控制的图像融合:一种扩散变压器方法
IEEE transactions on pattern analysis and machine intelligence
|December 11, 2025
概括
一个指令驱动的扩散变压器DiTFuse通过启用语义意识和用户控制来增强图像融合. 这种新的框架实现了在没有地面真相数据的情况下,在各种模式中实现强大,可适应和可控制的融合.
科学领域:
- 计算机视觉 计算机视觉
- 人工智能的人工智能
- 图像处理 图像处理
背景情况:
- 现有的图像融合方法缺乏稳定性,适应性和用户控制,特别是在具有挑战性的条件下,如低光或颜色转移.
- 当前的融合网络是特定任务的,并且很难结合高级语义理解或用户意图.
- 缺乏地面真相融合图像和有限的数据集大小阻碍了对复杂的融合任务进行端到端模型的训练.
研究的目的:
- 介绍DiTFuse,一个新的指令驱动的扩散变压器框架,用于端到端,语义意识的图像融合.
- 通过使用自然语言指令来实现对核聚变动态的层次和细粒度控制.
- 通过将语义理解直接集成到融合过程中,克服融合前和后管道的局限性.
主要方法:
- 在指令驱动的融合中,DiTFuse将图像和自然语言指令共同编码到共享的潜空间中.
- 一个多降解的蒙面图像建模策略训练网络进行跨模态对齐和模态不变的恢复,没有地面真相.
- 一个精心策划的指令数据集促进了交互式核聚变能力和对新核聚变场景的零射击概括.
主要成果:
- 在红外可见,多焦点和多曝光的融合基准上,DiTFuse表现出卓越的定量和质量性能.
- 与现有方法相比,该框架实现了更清晰的纹理和更好的语义保留.
- 实验证实了DiTFuse能够支持多层次的用户控制,并将其泛化为指令条件分段任务.
结论:
- DiTFuse提供了一种统一的,指令驱动的图像融合方法,显著提高了强度,适应性和可控性.
- 该模型有效地整合了语义理解和用户意图,克服了先前融合技术的关键局限性.
- DiTFuse 提供了一种多功能架构,能够处理多种融合任务,并允许新型应用,如指令条件分割.

