Video Experimental Relacionado
Updated: Jan 18, 2026

Author Spotlight: Enhancement of Salient Object Detection for Smart Grid Applications
Published on: December 15, 2023
DMDNet: Red neuronal de fusión profunda multimodal de doble rama para la detección de objetos salientes V-D-T
Yaoqi Sun1, Bin Wan2, Haibing Yin3
1School of Artificial Intelligence, Lishui University, Lishui, 323000, China; Lishui Institute of Hangzhou Dianzi University, Hangzhou Dianzi University, Hangzhou, 310018, China.
Este estudio presenta una red de fusión profunda multimodal de doble rama (DMDNet) para la detección de objetos salientes. DMDNet mejora la precisión al fusionar características más tarde en el proceso, reduciendo el ruido y mejorando el rendimiento de la detección.
Área de la Ciencia:
- Visión por Computadora
- Inteligencia Artificial
- Aprendizaje Automático
Sus antecedentes:
- La fusión directa de características multimodales (visibles, de profundidad, térmicas) en las primeras etapas de codificación introduce ruido, lo que reduce la precisión de la detección de objetos salientes.
- Los métodos existentes a menudo tienen dificultades para integrar eficazmente la información complementaria de diferentes modalidades de sensores.
Objetivo del estudio:
- Proponer una novedosa red de fusión profunda multimodal de doble rama (DMDNet) para mejorar la detección de objetos salientes.
- Abordar el desafío de la amplificación de ruido en la fusión temprana de características realizando la fusión en la fase del decodificador.
Principales métodos:
- DMDNet utiliza ramas de codificador separadas para imágenes visibles y una rama combinada para imágenes de profundidad y térmicas.
- La red incorpora un módulo de interacción modal (MI) para la complementariedad de profundidad-térmica, percepción de características multiescala (MFP) y módulos de optimización de región (RO).
- Un módulo de fusión de doble rama (DF) integra características de abajo hacia arriba para la generación del mapa de saliencia final.
Principales resultados:
- DMDNet demuestra un rendimiento superior en el conjunto de datos VDT-2048.
- Los resultados experimentales validan la efectividad de la arquitectura de red y la estrategia de fusión propuestas.
Conclusiones:
- El DMDNet propuesto reduce eficazmente el ruido al retrasar la fusión multimodal a la fase del decodificador.
- La arquitectura de la red aprovecha con éxito las características complementarias de las modalidades visible, de profundidad y térmica para mejorar la detección de objetos salientes.
Videos de Conceptos Relacionados
Depth Perception and Spatial Vision
Uniform Depth Channel Flow
Deconvolution
Deconvolution involves several mathematical techniques to derive the impulse response. One common approach is polynomial division. In this method, the input and output sequences are treated as coefficients of...
Force Classification
Contact and non-contact forces are two of the most widely used categories of forces. As the name suggests, contact forces require physical contact between two objects to act upon each other. Examples of contact forces include frictional,...
Multi-input and Multi-variable systems
In the absence of...
Uniform Depth Channel Flow: Problem Solving