Video Experimental Relacionado
Updated: Sep 10, 2025

03:31
Author Spotlight: Enhancement of Salient Object Detection for Smart Grid Applications
Published on: December 15, 2023
635
Combinar el aprendizaje profundo con subtítulos de imágenes para la detección, clasificación e informes de
Haya Almalki1, Nahlah Algethami2
1Department of Computer Science, Saudi Electronic University, Riyadh, Saudi Arabia.
Scientific reports
|August 26, 2025
Resumen
Este estudio introduce un marco de IA que utiliza aprendizaje profundo y subtítulos de imágenes para detectar e informar automáticamente la contaminación visual en las ciudades saudíes. El sistema mejora la gestión urbana y la precisión de los informes para el desarrollo sostenible.
Área de la Ciencia:
- Ciencias del medio ambiente
- Ciencias de la computación
- Planificación urbana
Sus antecedentes:
- El rápido desarrollo urbano en Arabia Saudita, incluidas las iniciativas de Saudi Vision 2030, ha llevado a desafíos ambientales como la contaminación visual (VP).
- Los métodos actuales de notificación de la VP se basan en la introducción manual de datos a través de una aplicación en línea, que es propensa a errores.
- Se necesitan sistemas automatizados y precisos para controlar y gestionar la calidad del medio ambiente urbano.
Objetivo del estudio:
- Proponer un marco impulsado por la IA para la detección, clasificación e información automáticas de la contaminación visual.
- Integrar modelos de aprendizaje profundo (YOLOv5, EfficientDet) con técnicas de conjunto para mejorar la detección de VP.
- Para utilizar Bootstrapping Language-Image Pre-training (BLIP) para la generación automática de descripciones de informes basados en imágenes.
Principales métodos:
- Desarrolló un marco de IA que combina los modelos YOLOv5 y EfficientDet para la detección visual de la contaminación.
- Técnicas de conjunto empleadas para mejorar el rendimiento de los modelos individuales de aprendizaje profundo.
- BLIP-2 integrado (específicamente BLIP2-Flan-T5-XL) para el subtitulado automático de imágenes para generar descripciones de informes.
- Utilizó el
- Datos de contaminación visual de las carreteras públicas de Arabia Saudita
- para el desarrollo y la evaluación del marco.
Principales resultados:
- El enfoque conjunto logró una precisión promedio (mAP) de 0,95, un recuerdo de 0,95, una precisión de 0,91 y una puntuación F1 de 0,93.
- Los modelos individuales fueron superados por el método conjunto en la detección de contaminación visual.
- El modelo BLIP2-Flan-T5-XL demostró una precisión del 80% en la generación de texto descriptivo para imágenes urbanas basadas en la evaluación humana.
Conclusiones:
- El marco de IA propuesto automatiza efectivamente la detección y notificación de contaminación visual, reduciendo significativamente los errores asociados con la entrada manual.
- La integración del aprendizaje profundo y el subtítulo de imágenes facilita la creación de informes supervisados por los ciudadanos, mejorando la gestión urbana.
- Este enfoque impulsado por la IA contribuye a mejorar la calidad de vida y promover el desarrollo urbano sostenible en las ciudades saudíes.
Videos de Conceptos Relacionados
Aggregates Classification
381
Aggregate classification is generally based on its size, petrographic characteristics, weight, and source. Size classification ranges from coarse to fine aggregates, defined by the size of the particles. Coarse aggregates are particles that do not pass through ASTM sieve No. 4, and aggregates that pass through the sieve are fine aggregates.
Petrographic classification groups aggregates based on common mineralogical characteristics. Some of the common mineral groups found in aggregates are...
Petrographic classification groups aggregates based on common mineralogical characteristics. Some of the common mineral groups found in aggregates are...
381
Deconvolution
251
Deconvolution, also known as inverse filtering, is the process of extracting the impulse response from known input and output signals. This technique is vital in scenarios where the system's characteristics are unknown, and they must be inferred from the observable signals.
Deconvolution involves several mathematical techniques to derive the impulse response. One common approach is polynomial division. In this method, the input and output sequences are treated as coefficients of...
Deconvolution involves several mathematical techniques to derive the impulse response. One common approach is polynomial division. In this method, the input and output sequences are treated as coefficients of...
251

