Video Experimental Relacionado
Updated: Jan 21, 2026

Constructing and Visualizing Models using Mime-based Machine-learning Framework
Published on: July 22, 2025
Aceleración de la generación de conjuntos de datos para el aprendizaje automático mediante modelos de lenguaje
Paola Carou-Senra1, Lucía Rodríguez-Pombo1, Carmen Alvarez-Lorenzo1
1Departamento de Farmacología, Farmacia y Tecnología Farmacéutica, I+D Farma (GI-1645), Facultad de Farmacia, Instituto de Materiales (iMATUS) and Health Research Institute of Santiago de Compostela (IDIS), Universidade de Santiago de Compostela 15782 Santiago de Compostela, Spain.
Un nuevo marco GPT-4 automatiza la extracción de datos farmacéuticos de la literatura, creando conjuntos de datos de alta calidad. Esta ingeniería de indicaciones profunda reduce significativamente el esfuerzo manual y acelera el desarrollo de modelos de aprendizaje automático en dominios especializados.
Área de la Ciencia:
- Investigación farmacéutica
- Aprendizaje automático
- Ciencia de datos
Sus antecedentes:
- Los conjuntos de datos de alta calidad son cruciales para el aprendizaje automático (ML) en campos especializados como la investigación farmacéutica.
- La extracción manual de datos de la literatura científica consume mucho tiempo y mano de obra.
- Los métodos existentes tienen dificultades con las fuentes de datos heterogéneas en el desarrollo de fármacos.
Objetivo del estudio:
- Desarrollar un nuevo marco de ingeniería de indicaciones profunda para automatizar la generación de conjuntos de datos para la investigación farmacéutica.
- Transformar GPT-4 en una herramienta para la extracción acelerada y precisa de parámetros críticos de la literatura.
- Reducir el esfuerzo manual y el tiempo requerido para crear conjuntos de datos estructurados para modelos de ML.
Principales métodos:
- Se empleó una estrategia de indicaciones de conjuntos múltiples utilizando GPT-4 para analizar 70 artículos de texto completo sobre impresión de inyección de tinta farmacéutica.
- Se extrajeron y calcularon 22 variables relevantes para el dominio, categorizadas en parámetros de impresión, reología y dosis de fármacos.
- Los resultados se compararon rigurosamente con un conjunto de datos curado por humanos compilado por expertos en el campo.
Principales resultados:
- El marco GPT-4 logró una precisión general de 0.942 en 4.217 puntos de datos.
- Las variables calculadas demostraron una alta precisión (0.983), incluso con cálculos complejos y conversiones de unidades.
- El tiempo de procesamiento por artículo se redujo de horas de esfuerzo humano a menos de 3,5 minutos.
Conclusiones:
- El nuevo enfoque de ingeniería de indicaciones permite a GPT-4 generar conjuntos de datos confiables y de alta calidad derivados de la literatura.
- Este método reduce significativamente el esfuerzo manual y al mismo tiempo mantiene una precisión a nivel de experto para el entrenamiento de modelos de ML.
- La estrategia facilita la escalabilidad del aprendizaje automático en dominios farmacéuticos y otros dominios intensivos en datos.
Más Videos Relacionados
04:09Predicting Treatment Response to Image-Guided Therapies Using Machine Learning: An Example for Trans-Arterial Treatment of Hepatocellular Carcinoma
Published on: October 10, 2018
04:04Asthma Detection Research Based on Voice Signal Processing and Machine Learning
Published on: July 22, 2025
Videos de Conceptos Relacionados
Language
Corballis and Suddendorf (2007) and Tomasello and Rakoczy (2003) highlight the role of language in...
Simplified Synchronous Machine Model
In this model, each generator is connected to a...
Wind Turbine Machine Models
Induction machines interact through the rotating magnetic field generated by the stator and the rotor. The key parameter is slip, which is the difference between synchronous speed and rotor speed relative to synchronous speed. Slip is...
Conjugate Addition (1,4-Addition) vs Direct Addition (1,2-Addition)
Conjugate addition results in a thermodynamically stable product. The reaction retains the stronger C=O bond at the expense of the weaker C=C π bond. The process is slow as the β carbon is less electrophilic than the carbonyl carbon.
Direct addition products are...
Pharmaceutical Equivalents
Components of Language