Video Experimental Relacionado
Updated: Sep 9, 2025

Author Spotlight: Addressing Technical and Subjective Challenges in Measuring Classroom Attention
Published on: December 15, 2023
LLaVA-Pose: Ajuste de instrucciones integradas en puntos clave para la comprensión de la postura y la acción humanas
Dewen Zhang1, Tahir Hussain1, Wangpeng An2
1Department of Informatics, Graduate School of Informatics and Engineering, The University of Electro-Communications, Tokyo 182-8585, Japan.
Este estudio introduce datos integrados en puntos clave para mejorar los modelos de lenguaje visual (VLM) para comprender las posturas y acciones humanas. El ajuste fino con este conjunto de datos especializados mejora significativamente el rendimiento de VLM en tareas centradas en el ser humano.
Área de la Ciencia:
- Visión por computadora
- Inteligencia artificial
- Aprendizaje multimodal
Sus antecedentes:
- Los modelos actuales de lenguaje visual (VLM) sobresalen en tareas visuales generales, pero luchan con el reconocimiento de posturas y acciones humanas complejas.
- Esta limitación se debe a la falta de datos especializados de seguimiento de instrucciones para la comprensión visual centrada en el ser humano.
Objetivo del estudio:
- Desarrollar un método para generar datos especializados de lenguaje visual que integren puntos clave humanos con características visuales tradicionales.
- Crear un conjunto de datos completo para ajustar los VLM en tareas centradas en el ser humano, incluida la conversación, la descripción detallada y el razonamiento complejo.
- Establecer un punto de referencia para evaluar el rendimiento del modelo en la comprensión de la postura y la acción humanas.
Principales métodos:
- Datos de puntos clave humanos integrados con características visuales existentes como subtítulos y cuadros de límite.
- Construyó un conjunto de datos de 200 328 muestras centradas en tareas centradas en el ser humano.
- Estableció el punto de referencia de comprensión de la postura y la acción humanas extendidas (E-HPAUB).
- Ajuste fino del modelo LLaVA-1.5-7B utilizando el conjunto de datos generado para crear el modelo LLaVA-Pose.
Principales resultados:
- El modelo LLaVA-Pose demostró mejoras significativas en el índice de referencia E-HPAUB.
- Se logró un aumento del rendimiento general del 33,2% en comparación con el modelo basal LLaVA-1.5-7B.
- Validación de la eficacia de los datos integrados en puntos clave para mejorar la comprensión visual centrada en el ser humano.
Conclusiones:
- Los datos integrados en puntos clave son cruciales para el avance de los VLM en la comprensión de posturas y acciones humanas complejas.
- El método y el conjunto de datos propuestos mejoran efectivamente las capacidades del modelo multimodal para tareas visuales centradas en el ser humano.
Videos de Conceptos Relacionados
Absolute Motion Analysis- General Plane Motion
As the drone's propellers rotate, an upward force is generated that counteracts the force of gravity, enabling the drone to lift off from the ground. This initial movement of the drone is along a straight path, representing a form of translational motion. In this phase, every point on the...
Fixed Action Patterns
Muscle Coordination and Action
Agonists
Agonist muscles, often called prime movers, are the primary muscles responsible for producing a specific movement....
Relative Motion Analysis using Rotating Axes-Problem Solving
Here, in order to determine the magnitude of velocity and acceleration for point...
Planar Rigid-Body Motion
Planar motion is typically divided into three distinct categories. The first is rectilinear translation, demonstrated by a subway train that moves along...
Kinematic Equations: Problem Solving

