Video Experimental Relacionado
Updated: Sep 9, 2025

Using Looming Visual Stimuli to Evaluate Mouse Vision
Published on: June 13, 2019
Interacciones espaciales eficientes de alto orden para la percepción visual
Los investigadores desarrollaron la Convolución Recursiva con Puertas (g nConv) para implementar de manera eficiente las características clave del Transformador de Visión utilizando las convoluciones. Esta nueva operación mejora varios modelos de visión, mejorando el rendimiento en el reconocimiento de imágenes, el análisis 3D y las tareas de lenguaje visual.
Área de la Ciencia:
- Visión por computadora
- Aprendizaje profundo
- Inteligencia artificial
Sus antecedentes:
- Los transformadores de visión (ViT) logran el éxito a través del modelado espacial de la autoatención.
- Las redes neuronales convolucionales (CNN) son fundamentales en la visión por computadora.
- La integración de las fortalezas de ViT en las CNN es un área de investigación activa.
Objetivo del estudio:
- Introducir un marco basado en la convolución que replica el modelado espacial de ViT.
- Desarrollar una nueva operación, la Convolución Recursiva con Puertas (g nConv), para interacciones espaciales de alto orden.
- Para crear esquinas vertebrales versátiles (HorNet, Hor3D, HorCLIP) para diversas tareas visuales.
Principales métodos:
- Se propone la Convolución Recursiva con Puertas (g nConv) para interacciones espaciales eficientes de alto orden.
- Se desarrollaron columnas vertebrales de visión genéricas: HorNet (reconocimiento de imágenes), Hor3D (nubes de puntos), HorCLIP (lenguaje de visión).
- Integrado g nConv como un módulo plug-and-play en las arquitecturas existentes.
Principales resultados:
- HorNet tiene mejores resultados que Swin Transformers y ConvNeXt en ImageNet, COCO y ADE20K.
- g nConv mejora las tareas de predicción densas con un cálculo reducido.
- Hor3D muestra eficacia en la segmentación semántica 3D; HorCLIP sobresale en las tareas de lenguaje visual.
Conclusiones:
- g nConv combina efectivamente los méritos de ViT y CNN, ofreciendo una nueva operación básica para el modelado visual.
- La familia HorNet propuesta demuestra un gran rendimiento y escalabilidad.
- Las interacciones espaciales de alto orden a través de g nConv son beneficiosas en varias modalidades y tareas visuales.
Más Videos Relacionados
07:45Assessing Binocular Central Visual Field and Binocular Eye Movements in a Dichoptic Viewing Condition
Published on: July 21, 2020
07:12Development of a Gaze-Contingent Display Framework Designed for Perceptual and Oculomotor Research with Simulated Central Vision Loss
Published on: April 11, 2025
Videos de Conceptos Relacionados
Depth Perception and Spatial Vision
Visual System
Once through the pupil, the light passes through the lens, a...
Vision
Parallel Processing
Anatomy of the Eyeball
Gestalt Principles of Perception