Video Experimental Relacionado
Updated: Sep 10, 2025

06:19
Constructing and Visualizing Models using Mime-based Machine-learning Framework
Published on: July 22, 2025
634
Comparación de canalizaciones, modelos seq2seq y LLM para la extracción de información sobre enfermedades raras
Shashank Gupta1, Xuguang Ai1, Yuhang Jiang1
1University of Kentucky, Lexington, KY, USA.
Resumen
Los modelos de tubería y secuencia a secuencia se destacan en la extracción de relaciones de extremo a extremo (E2ERE) para datos biomédicos complejos. A pesar del auge de los grandes modelos de lenguaje (LLM), los métodos tradicionales E2ERE los superan cuando hay datos de formación disponibles.
Área de la Ciencia:
- Procesamiento del lenguaje natural biomédico (PNL)
- Extracción de información
- El descubrimiento del conocimiento
Sus antecedentes:
- La extracción de relaciones de extremo a extremo (E2ERE) es crucial para la construcción de gráficos de conocimiento biomédico.
- Los métodos E2ERE existentes a menudo luchan con entidades complejas (discontinuas, superpuestas, anidadas) que se encuentran en tareas a nivel de documento.
- El conjunto de datos RareDis presenta un caso de uso desafiante para E2ERE debido a estos rasgos complejos.
Objetivo del estudio:
- Evaluar y comparar el rendimiento de tres paradigmas E2ERE principales en un conjunto de datos complejo (RareDis).
- Determinar el enfoque E2ERE más adecuado para las tareas de PNL biomédica, especialmente cuando se trata de estructuras de datos complejas.
- Proporcionar evidencia empírica para guiar la elección de modelos E2ERE en el ámbito biomédico.
Principales métodos:
- Análisis comparativo de tres paradigmas de E2ERE: pipeline (NER + RC), secuencia a secuencia y modelos generativos de lenguaje grande (LLM).
- Utilizó el conjunto de datos RareDis, caracterizado por entidades complejas, para evaluar modelos representativos de cada paradigma.
- Los hallazgos validados en un segundo conjunto de datos se centraron en las interacciones química-proteína.
Principales resultados:
- Los modelos E2ERE basados en pipeline demostraron un rendimiento superior en el conjunto de datos de RareDis.
- Los modelos de secuencia a secuencia también funcionaron de manera competitiva, siguiendo de cerca los enfoques de la tubería.
- Se encontró que los modelos de lenguaje grande (LLM) son más efectivos en escenarios de tiro cero, pero menos óptimos que los modelos entrenados cuando hay datos disponibles.
Conclusiones:
- Para tareas complejas de extracción de relaciones biomédicas con datos de capacitación disponibles, se recomiendan modelos tradicionales o de secuencia a secuencia en lugar de modelos de lenguaje grandes.
- El estudio destaca la relevancia y eficacia continuas de los métodos E2ERE establecidos para los desafíos especializados de PNL biomédica.
- Esta investigación ofrece el primer análisis E2ERE sobre el conjunto de datos de RareDis, aportando información valiosa para el campo.
Palabras clave:
extracción de relaciones biomédicasModelos de codificador y descodificadorModelos de extremo a extremoextracción de informacióngrandes modelos de lenguaje
