Video Experimental Relacionado
Updated: Feb 17, 2026

Author Spotlight: UAV Remote Sensing for Efficient Invasive Plant Biomass Estimation
Published on: February 9, 2024
Modelos de lenguaje visual para detección de malezas y razonamiento visual de cero disparos en agricultura de
Muhammad Fahad Nasir1, Mobeen Ur Rehman2, Irfan Hussain1
1Khalifa University Center for Autonomous Robotic Systems, Khalifa University, Abu Dhabi, United Arab Emirates.
Los modelos de lenguaje visual (VLM) prometen para la gestión de malezas de precisión en la agricultura. Gemini Flash 2.5 demostró un sólido rendimiento de cero disparos y interpretabilidad, ofreciendo una alternativa de baja anotación a los métodos de aprendizaje profundo tradicionales para el análisis de imágenes de drones.
Área de la Ciencia:
- Ciencia Agrícola
- Visión por Computadora
- Inteligencia Artificial
Sus antecedentes:
- Las malezas reducen significativamente el rendimiento de los cultivos en hilera, lo que requiere estrategias de manejo efectivas.
- Los métodos actuales de aprendizaje profundo para la detección de malezas utilizando imágenes de UAV requieren una anotación de datos extensa y exhiben una mala generalización.
- La limitada interpretabilidad de los modelos existentes dificulta la confianza y la adopción en aplicaciones agrícolas.
Objetivo del estudio:
- Evaluar la eficacia de los modelos modernos de lenguaje visual (VLM) en un entorno de cero disparos para la detección y gestión de malezas en campos de soja.
- Evaluar las capacidades de los VLM para identificar la presencia de malezas, la localización espacial, el tipo de cultivo y la etapa de crecimiento.
- Introducir y validar el Error-Probing Prompting (EPP) para mejorar la interpretabilidad y la autocorrección de los VLM.
Principales métodos:
- Se evaluaron seis VLM comerciales (ChatGPT-4.1, ChatGPT-4o, Gemini Flash 2.5, Gemini Flash Lite 2.5, LLaMA-4 Scout, LLaMA-4 Maverick) utilizando imágenes de drones de campos de soja.
- Se diseñó un prompt unificado para solicitar la presencia de malezas, la localización espacial, el razonamiento, la etapa de crecimiento del cultivo y el tipo de cultivo.
- Se introdujo el Error-Probing Prompting (EPP) como un método de análisis contrafactual para probar la robustez del modelo y las capacidades de autocorrección.
- La interpretabilidad se cuantificó utilizando puntuaciones calificadas por expertos para Anclaje, Especificidad, Plausibilidad, No alucinación y Accionabilidad.
Principales resultados:
- Gemini Flash 2.5 exhibió el rendimiento de cero disparos más consistente y la mayor interpretabilidad.
- ChatGPT-4.1 mostró un fuerte razonamiento pero una menor precisión en la detección, mientras que ChatGPT-4o proporcionó un rendimiento equilibrado.
- Las variantes de LLaMA-4 demostraron limitaciones en la localización y especificidad.
- Gemini Flash Lite 2.5 fue eficiente pero careció de robustez bajo las pruebas de estrés de EPP, lo que indica un razonamiento frágil.
- Las puntuaciones de interpretabilidad se correlacionaron positivamente con la corrección espacial, como lo indican las métricas de anclaje visual y superposición de texto a región.
Conclusiones:
- Los modelos de lenguaje visual ofrecen un enfoque prometedor de baja anotación para la gestión de malezas de precisión.
- La confiabilidad del modelo en el despliegue de campo se predice mejor por la explicabilidad y la adaptabilidad que por la escala sola.
- Gemini Flash 2.5 emergió como un intérprete superior, destacando el potencial de los VLM para aplicaciones agrícolas prácticas.
- La investigación adicional sobre la explicabilidad de los VLM y la adaptabilidad impulsada por retroalimentación es crucial para avanzar en los sistemas agrícolas automatizados.
Videos de Conceptos Relacionados
Depth Perception and Spatial Vision
Light Acquisition
Vision
Application of Linearization and Approximation
