Video Experimental Relacionado
Updated: Jan 14, 2026

Augmenting Large Language Models via Vector Embeddings to Improve Domain-Specific Responsiveness
Published on: December 6, 2024
Aprovechamiento de Modelos Lingüísticos Grandes de IA para la Redacción de Propuestas de Ensayos Clínicos en
Megan Hauptman1, Daniel Copley2, Kelly Young1
1Department of Dermatology, University of Michigan, 1500 E Medical Center Dr, Ann Arbor, MI, 48105, United States, 1 734-936-4054.
Los modelos lingüísticos grandes (LLM) muestran ser prometedores en el desarrollo de propuestas de investigación, siendo las versiones de pago de ChatGPT las más capaces. Aunque no reemplazan a los expertos, los LLM pueden asistir y acelerar significativamente el proceso de propuesta.
Área de la Ciencia:
- Inteligencia Artificial en Salud
- Operaciones de Investigación Clínica
- Procesamiento del Lenguaje Natural
Sus antecedentes:
- Los modelos lingüísticos grandes (LLM) se adoptan cada vez más en el diseño de ensayos clínicos.
- Su aplicación en el desarrollo de propuestas de investigación sigue estando infrautilizada.
- Este estudio evalúa la eficacia de los LLM en la creación y evaluación de propuestas de investigación.
Objetivo del estudio:
- Comparar el rendimiento de los modelos lingüísticos grandes (LLM) de acceso abierto frente a expertos humanos en la redacción y revisión de propuestas de investigación.
- Evaluar la precisión y exhaustividad de las propuestas de investigación generadas por LLM.
Principales métodos:
- Se encargó a diez modelos lingüísticos grandes (LLM) la generación de propuestas de investigación.
- Seis médicos y los propios LLM evaluaron once propuestas de investigación ciegas.
- Las evaluaciones se centraron en la precisión y exhaustividad de la propuesta.
Principales resultados:
- Los evaluadores humanos identificaron ChatGPT-o1 como el más preciso y Llama 3.1 como el menos preciso.
- Los evaluadores de LLM encontraron ChatGPT-o1 y DeepSeek R1 como los más precisos.
- ChatGPT-o1 y Llama 3.1 fueron calificados como los más y menos completos, respectivamente, tanto por evaluadores humanos como de LLM.
- Los LLM generalmente sobreestimaron la calidad de la propuesta, calificándola en promedio 1.9 puntos más alto que los humanos.
Conclusiones:
- Las versiones de pago de ChatGPT ofrecen la mayor calidad y versatilidad entre los LLM actuales para tareas de propuestas de investigación.
- Los LLM pueden funcionar como valiosos asistentes, mejorando la eficiencia y la productividad en el desarrollo de la investigación.
- La aportación de expertos humanos sigue siendo indispensable, ya que los LLM no pueden reemplazar por completo el juicio matizado de los investigadores experimentados.
Más Videos Relacionados
Videos de Conceptos Relacionados
Clinical Trials
There are four phases in a clinical trial. A phase one...
Improving Translational Accuracy
Improving Translational Accuracy
Clinical Trials: Overview
Statistical Software for Data Analysis and Clinical Trials

