Video Experimental Relacionado
Updated: Jun 17, 2026

A Metadata Extraction Approach for Clinical Case Reports to Enable Advanced Understanding of Biomedical Concepts
Published on: September 20, 2018
Desarrollo y Evaluación de un Pipeline para la Extracción de Datos Estructurados a partir de Informes Médicos de
Enzo Joseph1, Paul Vallee1, Tanguy Perennec2
1Data Factory & Analytics Department, Institut de Cancérologie de l'Ouest, Nantes-Angers, France.
Los modelos de lenguaje grandes (LLMs) como Mistral Large pueden extraer con precisión biomarcadores de cáncer de mama de informes de patología. Esta tecnología muestra una gran promesa para la estructuración de datos clínicos y el avance de la transformación digital de la atención médica.
Área de la Ciencia:
- Informática Biomédica
- Procesamiento del Lenguaje Natural
- Oncología
Sus antecedentes:
- Los informes de patología contienen datos clínicos cruciales para el cáncer de mama (BC) pero son difíciles de estructurar a escala.
- Los métodos tradicionales de procesamiento del lenguaje natural (PLN) requieren una anotación y entrenamiento manuales extensos.
- Los modelos de lenguaje grandes (LLMs) ofrecen una solución potencial para la extracción automatizada de datos.
Objetivo del estudio:
- Investigar la eficacia del LLM Mistral Large para la extracción automática de tres biomarcadores clave de cáncer de mama (BC) de informes de patología no estructurados.
- Evaluar el rendimiento de un pipeline basado en LLM para la estructuración de datos clínicos.
Principales métodos:
- Se desarrolló y evaluó un pipeline que combina el LLM Mistral Large con una fase de posprocesamiento.
- Se evaluó el rendimiento en dos conjuntos de datos: 1152 informes de patología de BC y una base de datos de referencia de 101 pacientes con BC metastásico.
- Se exploró el impacto de las indicaciones de confianza (CP), la cadena de pensamiento (CoT) y los ejemplos few-shot en el rendimiento del pipeline.
Principales resultados:
- Se lograron puntuaciones F1 a nivel de documento >95% y recall/precisión >94% para el estado/puntuación del receptor de estrógeno, receptor de progesterona y HER2.
- Las puntuaciones F1 a nivel de paciente oscilaron entre 87%-90%, con un recall entre 83%-87% y una precisión >90%.
- El rendimiento del pipeline fue consistente independientemente de la inclusión de CP, CoT o ejemplos few-shot.
Conclusiones:
- Se demostró el potencial significativo de los LLMs como Mistral Large para extraer datos estructurados de biomarcadores de cáncer de mama de informes de patología.
- Se destacó la utilidad de los enfoques basados en LLM para la transformación digital de documentos de atención médica.
Más Videos Relacionados
03:14Augmenting Large Language Models via Vector Embeddings to Improve Domain-Specific Responsiveness
Published on: December 6, 2024
05:47Evidence-based Knowledge Synthesis and Hypothesis Validation: Navigating Biomedical Knowledge Bases via Explainable AI and Agentic Systems
Published on: June 13, 2025