Video Experimental Relacionado
Updated: Feb 24, 2026

Using Eye Movements Recorded in the Visual World Paradigm to Explore the Online Processing of Spoken Language
Published on: October 13, 2018
Refinamiento Visual Autosupervisado para Modelos Autorregresivos
Jiamian Wang1, Ziqi Zhou1, Chaithanya Kumar Mummadi2
1Rochester Institute of Technology.
Este estudio presenta un módulo de refinamiento para mejorar los modelos autorregresivos en tareas de visión y lenguaje. El método mejora la correspondencia espacial y reduce los errores en la generación secuencial, lo que conduce a resultados más consistentes.
Área de la Ciencia:
- Ciencias de la Computación
- Inteligencia Artificial
- Aprendizaje Automático
Sus antecedentes:
- Los modelos autorregresivos son efectivos para datos secuenciales, incluidas las tareas de visión y lenguaje.
- Existen desafíos en el modelado de datos visuales espaciales dentro de marcos de predicción secuencial.
- Los métodos existentes pueden sufrir resultados subóptimos debido al conflicto entre las características de los datos espaciales y secuenciales.
Objetivo del estudio:
- Proponer un módulo de refinamiento conectable para mejorar el modelado de correspondencia espacial en modelos autorregresivos de visión y lenguaje.
- Mejorar la calidad y la consistencia semántica de las secuencias visuales generadas.
- Mitigar los problemas de acumulación de errores inherentes a la generación secuencial.
Principales métodos:
- Se introduce un nuevo módulo de refinamiento como un paso posterior a la preformación.
- El módulo refina conjuntamente todos los tokens generados dentro del modelo autorregresivo.
- Aprovecha el contexto global y las relaciones inter-token para un mejor modelado.
Principales resultados:
- El método propuesto mejora significativamente las capacidades de modelado de visión y lenguaje.
- Mejora la calidad de las secuencias visuales generadas.
- La acumulación de errores en la generación secuencial se mitiga de manera efectiva.
Conclusiones:
- El módulo de refinamiento ofrece una solución práctica para mejorar los modelos autorregresivos de visión y lenguaje.
- El enfoque aborda con éxito el desafío de la integración de datos espaciales-secuenciales.
- El método conduce a resultados de mayor calidad y más consistentes semánticamente en la generación de visión y lenguaje.
Más Videos Relacionados
Videos de Conceptos Relacionados
Residuals and Least-Squares Property
If the observed data point lies above the line, the residual is positive, and the line underestimates the actual data value for y. If the observed data point lies below the line, the residual is negative, and the line overestimates the actual data value for y.
The process of fitting the best-fit...
Regression Toward the Mean
Self-Evaluation Maintenance Model
Self-Evaluation: Self-Enhancement and Self-Verification
Improving Translational Accuracy
Improving Translational Accuracy

