Video Experimental Relacionado
Updated: Sep 8, 2025

Combining Eye-tracking Data with an Analysis of Video Content from Free-viewing a Video of a Walk in an Urban Park Environment
Published on: May 7, 2019
Los modelos de lenguaje de visión compactos permiten un análisis automatizado e interpretable de los PTU a través del
Tania Haghighi1, Sina Gholami1, Jared Todd Sokol2
1Department of Electrical and Computer Engineering, University of North Carolina at Charlotte, Charlotte, NC 28223, USA.
Desarrollamos LO-VLM, un eficiente modelo de IA para interpretar escáneres OCT B, para generar narrativas clínicas precisas y clasificar enfermedades de la retina. Este modelo de lenguaje visual supera significativamente a los métodos existentes tanto en la generación de resúmenes como en la precisión del diagnóstico.
Área de la Ciencia:
- Oftalmología
- Inteligencia artificial
- Imágenes médicas
Sus antecedentes:
- La interpretación de las exploraciones B de la Tomografía de Coherencia Óptica (OCT) para enfermedades de la retina requiere una IA que combine datos visuales con conocimientos médicos.
- Los modelos de IA existentes luchan por traducir con precisión las características de las imágenes OCT en narrativas clínicas.
Objetivo del estudio:
- Introducir LO-VLM, un nuevo y compacto modelo de lenguaje visual (VLM) diseñado para la interpretación de escáneres B de los PTU.
- Mejorar la generación de resúmenes en forma libre y la clasificación de enfermedades multiclases de las afecciones de la retina.
Principales métodos:
- Curated un conjunto de datos multimodal de 40.000 OCT B-escaneos con resúmenes validados por expertos para seis condiciones.
- Desarrollado LO-VLM, un VLM de parámetro 247M que incorpora guía anatómica en su codificador y descodificador.
- Se comparó el LO-VLM con el RetinaVLM, el LLaVA-Med y un modelo ViT.
Principales resultados:
- Los relatos LO-VLM recibieron puntuaciones significativamente más altas (8.5/10) de los especialistas en retina en comparación con RetinaVLM (5.5/10).
- Se obtuvieron métricas cuantitativas superiores: 0.803 de similitud SBERT y 0.715 de puntuación BERTScore F1.
- Alcanzó un 96% de precisión en la clasificación de enfermedades, superando a ViT en un 13% y a los VLM médicos en más de un 62%.
Conclusiones:
- LO-VLM ofrece un nuevo paradigma para una IA eficiente e interpretable en el análisis de los PTU.
- El modelo demuestra un rendimiento superior tanto en la generación de relatos clínicos como en la clasificación de enfermedades de la retina.
- LO-VLM concilia la eficiencia computacional con una alta precisión para la interpretación de los PTU.

