Video Experimental Relacionado
Updated: Sep 9, 2025

03:14
Augmenting Large Language Models via Vector Embeddings to Improve Domain-Specific Responsiveness
Published on: December 6, 2024
680
VIDHALLUC: Evaluación de las alucinaciones temporales en modelos multimodales de lenguaje grande para la comprensión
Chaoyu Li1, Eun Woo Im1, Pooyan Fazli1
1Arizona State University.
Resumen
Los modelos multimodales de lenguaje grande (MLLM) luchan con las alucinaciones de video. Introducimos VIDHALLUC, un punto de referencia, y DINO-HEAL, un método que mejora la precisión de MLLM en la comprensión de vídeo.
Área de la Ciencia:
- Inteligencia artificial
- Visión por computadora
- Aprendizaje automático
Sus antecedentes:
- Los modelos multimodales de lenguaje grande (MLLM) demuestran capacidades avanzadas de comprensión de video.
- La alucinación, la generación de contenido inexacto, es un desafío importante en el análisis de video MLLM.
- Los codificadores visuales MLLM existentes a menudo confunden contenido de video visualmente similar pero semánticamente distinto.
Objetivo del estudio:
- Introducir VIDHALLUC, el mayor punto de referencia para evaluar las alucinaciones MLLM en la comprensión de video.
- Evaluar la vulnerabilidad de MLLM a las alucinaciones a través de la acción, la secuencia temporal y la transición de la escena.
- Proponer DINO-HEAL, un nuevo método para mitigar las alucinaciones de vídeo.
Principales métodos:
- Desarrollo del índice de referencia VIDHALLUC que incluye 5.002 vídeos emparejados.
- Pruebas exhaustivas de varios MLLM en el índice de referencia VIDHALLUC.
- Introducción de DINO-HEAL, una técnica libre de entrenamiento que utiliza la saliencia espacial DINOv2 para el nuevo peso de las características.
Principales resultados:
- La mayoría de los MLLM exhiben alucinaciones significativas a través de la acción, la secuencia temporal y las dimensiones de transición de la escena.
- DINO-HEAL reduce efectivamente las alucinaciones en pacientes con MLLM.
- DINO-HEAL logró una mejora promedio del 3,02% en la mitigación de alucinaciones en diferentes tareas.
Conclusiones:
- Los MLLM son susceptibles a las alucinaciones en las tareas de comprensión de video.
- El índice de referencia VIDHALLUC proporciona un recurso fundamental para evaluar y abordar estas limitaciones.
- DINO-HEAL ofrece una solución práctica y efectiva para reducir las alucinaciones de video MLLM sin reentrenamiento.
Videos de Conceptos Relacionados
Higher Mental Functions of the Brain: Language
1.0K
Language is a system of communication that allows the expression of thoughts, ideas, and feelings. The brain processes language in both hemispheres.
Language formation and comprehension take place in the dominant hemisphere. The dominant hemisphere is responsible for understanding the meaning of spoken, written, or sign language, as well as the ability to communicate. For most people, the left hemisphere is the dominant one. The right hemisphere, then, gives tone and emotional context to the...
Language formation and comprehension take place in the dominant hemisphere. The dominant hemisphere is responsible for understanding the meaning of spoken, written, or sign language, as well as the ability to communicate. For most people, the left hemisphere is the dominant one. The right hemisphere, then, gives tone and emotional context to the...
1.0K
Chunking and Rehearsal in Sensory Memory
293
Improving short-term memory can be achieved through techniques like chunking and rehearsal. Chunking involves organizing information into larger, more manageable units. This technique is particularly useful for information that exceeds the typical memory span of between five and nine items. For instance, logging into an online account with a password like "ta89vq0179gz" involves grouping letters and numbers into three chunks—ta89, vq01, and 79gz. It makes large amounts of...
293

