VIDHALLUC: Evaluación de las alucinaciones temporales en modelos multimodales de lenguaje grande para la comprensión

Chaoyu Li1, Eun Woo Im1, Pooyan Fazli1

  • 1Arizona State University.

Proceedings. IEEE Computer Society Conference on Computer Vision and Pattern Recognition
|September 5, 2025
PubMed
Resumen

Los modelos multimodales de lenguaje grande (MLLM) luchan con las alucinaciones de video. Introducimos VIDHALLUC, un punto de referencia, y DINO-HEAL, un método que mejora la precisión de MLLM en la comprensión de vídeo.