Video Experimental Relacionado
Updated: Feb 12, 2026

Defining the Role Of Language in Infants' Object Categorization with Eye-tracking Paradigms
Published on: February 8, 2019
Monocular Multi-objeto 3D Rastreo del lenguaje visual de seguimiento.
Este estudio introduce el primer método para el seguimiento del lenguaje visual 3D de múltiples objetos (VLT) utilizando video monocular. El nuevo enfoque permite un seguimiento preciso en 3D de múltiples objetos desde una sola cámara, superando las limitaciones anteriores.
Área de la Ciencia:
- Visión por ordenador Visión por ordenador Visión por ordenador Visión por ordenador Visión por ordenador
- La inteligencia artificial es inteligencia artificial.
- Robótica y Robótica Robótica y Robótica Robótica Robótica Robótica Robótica Robótica Robótica
Sus antecedentes:
- Los métodos existentes de seguimiento de lenguaje visual (VLT) se limitan al seguimiento 2D o 3D de un solo objeto.
- El actual seguimiento 3D de múltiples objetos se basa en datos de sensores que carecen de descripciones de lenguaje.
- Las descripciones de lenguaje redundantes impiden una localización precisa de múltiples objetos en VLT.
Objetivo del estudio:
- Para extender el seguimiento del lenguaje visual (VLT) al seguimiento 3D de múltiples objetos utilizando video monocular.
- Introducir un nuevo marco, conjunto de datos y modelo neuronal para esta tarea.
- Para permitir un seguimiento 3D robusto de múltiples objetos desde un video monocular utilizando guía de lenguaje.
Principales métodos:
- Introdujo la tarea y el conjunto de datos Monocular Multi-object 3D Visual Language Tracking (MoMo-3DVLT) y el conjunto de datos (MoMo-3DRoVLT).
- Desarrolló MoMo-3DVLTracker, un modelo neuronal con extracción de características multimodal y un codificador-decodificador de lenguaje.
- Integró un mecanismo diferenciado de memoria vinculada con un razonamiento guiado en profundidad y condicionado por el lenguaje.
Principales resultados:
- El MoMo-3DVLTracker propuesto logra un rendimiento de vanguardia en el conjunto de datos MoMo-3DRoVLT.
- Demostró una precisión superior de seguimiento 3D de múltiples objetos utilizando video monocular en comparación con los métodos existentes.
- El conjunto de datos personalizado proporciona extensas anotaciones en 3D y descripciones en lenguaje natural para la investigación del VLT.
Conclusiones:
- Este trabajo presenta la primera extensión exitosa del VLT al seguimiento 3D de múltiples objetos con video monocular.
- El marco, el conjunto de datos y el modelo desarrollados establecen una nueva línea de base para esta tarea desafiante.
- El enfoque ofrece una dirección prometedora para aplicaciones del mundo real que requieren seguimiento de objetos 3D guiado por lenguaje.
Más Videos Relacionados
07:36Eye Tracking During Visually Situated Language Comprehension: Flexibility and Limitations in Uncovering Visual Context Effects
Published on: November 30, 2018
06:07Exploring Infant Sensitivity to Visual Language using Eye Tracking and the Preferential Looking Paradigm
Published on: May 15, 2019
Videos de Conceptos Relacionados
Language
Corballis and Suddendorf (2007) and Tomasello and Rakoczy (2003) highlight the role of language in...
Components of Language
Language Development
The critical period for language acquisition suggests that the ability to acquire language is at its peak early in life. As people age, this proficiency decreases. Language development begins very...
Language and Cognition
Velocity of an Object
Higher Mental Functions of the Brain: Language
Language formation and comprehension take place in the dominant hemisphere. The dominant hemisphere is responsible for understanding the meaning of spoken, written, or sign language, as well as the ability to communicate. For most people, the left hemisphere is the dominant one. The right hemisphere, then, gives tone and emotional context to the...