Video Experimental Relacionado
Updated: Jan 7, 2026

Evidence-based Knowledge Synthesis and Hypothesis Validation: Navigating Biomedical Knowledge Bases via Explainable AI and Agentic Systems
Published on: June 13, 2025
Integración de la curación en la publicación científica para entrenar modelos de IA
Jorge Abreu-Vicente1, Hannah Sonntag1, Thomas Eidens1
1EMBO, Heidelberg, 69117, Germany.
Este estudio integra la curación de datos en la publicación académica, creando un gran conjunto de datos (SourceData-NLP) para el aprendizaje automático. Esto permite un mejor análisis de las figuras y textos de investigación biomédica.
Área de la Ciencia:
- Informática Biomédica
- Biología Computacional
- Publicación Científica
Sus antecedentes:
- La extracción de datos de alto rendimiento y el etiquetado estructurado de artículos académicos son vitales para el aprendizaje automático y los análisis secundarios.
- Los métodos existentes carecen de integración con el flujo de trabajo de publicación y de anotación integral de roles y metodologías experimentales.
- Existe la necesidad de reconocimiento y anotación avanzados de bioentidades dentro de la literatura científica.
Objetivo del estudio:
- Integrar la curación de datos multimodales en el proceso de publicación académica.
- Crear un conjunto de datos completo para entrenar modelos de IA en investigación biomédica.
- Mejorar la precisión de la anotación de paneles y leyendas de figuras.
Principales métodos:
- Integración de la curación de datos multimodales en el flujo de trabajo de publicación académica.
- Utilización de procesamiento del lenguaje natural y retroalimentación de autores para la anotación.
- Anotación de paneles y leyendas de figuras segmentadas de artículos de biología molecular y celular.
- Desarrollo de nuevas tareas de IA para evaluar la utilidad del conjunto de datos, incluido el reconocimiento de entidades nombradas y el análisis semántico dependiente del contexto.
Principales resultados:
- Se creó el conjunto de datos SourceData-NLP con más de 620 000 entidades biomédicas anotadas de 18 689 figuras en 3 223 artículos.
- Las anotaciones incluyen ocho clases de bioentidades y roles/metodologías experimentales.
- Se demostró la utilidad del conjunto de datos para el entrenamiento de modelos de IA en el reconocimiento de entidades nombradas, la segmentación de leyendas de figuras y tareas semánticas novedosas.
- Se mostraron aplicaciones multimodales para segmentar figuras en paneles y leyendas.
Conclusiones:
- El conjunto de datos SourceData-NLP mejora significativamente las aplicaciones de aprendizaje automático en investigación biomédica.
- La integración de la curación de datos en la publicación agiliza la creación de conjuntos de datos valiosos y estructurados.
- Los modelos y el conjunto de datos desarrollados facilitan el análisis avanzado de figuras y textos científicos.
Videos de Conceptos Relacionados
Improving Translational Accuracy
Improving Translational Accuracy
The Scientific Method
The Scientific Method
Generally, predictions are tested using carefully-designed experiments. Based on the outcome of these...
CRISPR and crRNAs
The CRISPR-Cas system stores a copy of foreign DNA in the host genome and uses it to identify the foreign DNA upon reinfection. CRISPR-Cas has three different...
Nature and Nurture

