Video Experimental Relacionado
Updated: Jun 29, 2026

Application of Deep Learning-Based Medical Image Segmentation via Orbital Computed Tomography
Published on: November 30, 2022
SurgLaVi: Conjunto de datos jerárquico a gran escala para el aprendizaje de representación de visión y lenguaje en
Alejandra Perez1, Chinedu Nwoye2, Ramtin Raji Kermani2
1Intuitive Surgical, Inc., Sunnyvale, CA, United States; Center for Research and Formation in Artificial Intelligence (CinfonIA), Universidad de los Andes, Bogotá, Colombia.
Los investigadores desarrollaron SurgLaVi, un gran conjunto de datos de visión y lenguaje quirúrgico, para mejorar la comprensión de la IA de los vídeos quirúrgicos. Este conjunto de datos permite un mejor análisis del flujo de trabajo quirúrgico y el entrenamiento de modelos de IA para mejorar la atención quirúrgica.
Área de la Ciencia:
- Visión por Computadora
- Inteligencia Artificial
- Informática Médica
Sus antecedentes:
- El preentrenamiento de visión y lenguaje (VLP) muestra una gran promesa para el análisis de vídeos quirúrgicos, pero está limitado por conjuntos de datos pequeños y no diversos.
- Los conjuntos de datos de VLP quirúrgicos existentes carecen de escala, variedad de procedimientos, profundidad semántica y estructura jerárquica.
Objetivo del estudio:
- Presentar SurgLaVi, el conjunto de datos quirúrgico de visión y lenguaje más grande y diverso.
- Permitir modelos avanzados de IA para la comprensión y generalización del flujo de trabajo quirúrgico.
- Proporcionar un conjunto de datos accesible y de código abierto (SurgLaVi-β) para una investigación más amplia.
Principales métodos:
- Desarrollaron un pipeline totalmente automatizado para generar transcripciones y segmentaciones detalladas de vídeos quirúrgicos.
- Implementaron el filtrado de modalidad dual para garantizar anotaciones de alta calidad y semánticamente ricas.
- Crearon SurgCLIP, un marco de contraste de vídeo y texto al estilo CLIP, para evaluar la utilidad del conjunto de datos.
Principales resultados:
- SurgLaVi contiene casi 240 000 pares de clips y subtítulos en más de 200 procedimientos con anotaciones jerárquicas.
- SurgLaVi-β ofrece 113 000 pares de clips y subtítulos de datos públicos, significativamente más grandes que los conjuntos de datos anteriores.
- SurgCLIP demostró mejoras sustanciales en el reconocimiento de fases, pasos, acciones y herramientas quirúrgicas.
Conclusiones:
- Los conjuntos de datos a gran escala, semánticamente ricos y estructurados jerárquicamente son cruciales para desarrollar una IA quirúrgica robusta.
- SurgLaVi es un recurso clave para avanzar en los modelos fundacionales quirúrgicos y las aplicaciones quirúrgicas impulsadas por IA.
- El conjunto de datos facilita una mejor comprensión y generalización en el análisis de vídeos quirúrgicos.
Videos de Conceptos Relacionados
Genetic Lingo
Higher Mental Functions of the Brain: Language
Language formation and comprehension take place in the dominant hemisphere. The dominant hemisphere is responsible for understanding the meaning of spoken, written, or sign language, as well as the ability to communicate. For most people, the left hemisphere is the dominant one. The right hemisphere, then, gives tone and emotional context to the...
Introduction to Language of Pathophysiology l
Introduction to Language of Pathophysiology ll

