Video Experimental Relacionado
Updated: Feb 13, 2026

Orthotopic Aortic Transplantation: A Rat Model to Study the Development of Chronic Vasculopathy
Published on: December 4, 2010
Evaluación de grandes modelos de lenguaje para la revisión por pares en la investigación de trasplantes: estudio de
Selena Ming Shen1, Zifu Wang2, Krittika Paul3
1Pine View School, Osprey, FL, United States.
Los modelos de lenguaje grande (LLM) son prometedores para ayudar en la revisión científica por pares, particularmente en el trasplante de órganos. Sin embargo, los LLM actuales carecen de la precisión para una revisión independiente y requieren supervisión humana.
Área de la Ciencia:
- La investigación médica es la investigación médica.
- La inteligencia artificial en la ciencia.
Sus antecedentes:
- La revisión por pares es crucial para la calidad de la investigación, pero se enfrenta a desafíos por la fatiga y el sesgo de los revisores.
- El creciente volumen de publicaciones científicas requiere explorar soluciones de IA como modelos de lenguaje grande (LLM) para el apoyo de revisión por pares.
Objetivo del estudio:
- Para comparar el rendimiento de cinco LLMs de código abierto en la revisión de documentos de trasplante de órganos.
- Evaluar el impacto de las afiliaciones de los autores en los resultados de las revisiones de LLM.
- Examinar la efectividad de diferentes estrategias de ingeniería rápida (zero-shot, few-shot, ToT, RAG) en las decisiones de revisión de LLM.
Principales métodos:
- Se evaluaron 200 trabajos de trasplante utilizando cinco LLM (Llama 3.3, Mistral 7B, Gemma 2, DeepSeek r1-distillado Qwen, Qwen 2.5).
- Se probaron cuatro estrategias de ingeniería rápidas (zero-shot, few-shot, ToT, RAG) a través de varios ajustes de temperatura.
- Evaluó el desempeño de LLM en la categorización de cuartiles, considerando las afiliaciones de los autores (prestigioso, menos prestigioso, ninguno) para detectar sesgos.
Principales resultados:
- La generación aumentada de recuperación (RAG) con una temperatura de 0,5 produjo el mejor rendimiento (0,35 precisión de coincidencia exacta).
- Los LLM tendían a asignar trabajos a los cuartiles medios (2 y 3), evitando los extremos.
- No se detectó un sesgo de afiliación significativo en los modelos, aunque algunos mostraron un sesgo marginal (Gemma 2, Qwen 2.5).
- Mistral demostró la mayor precisión (0.35) con el menor costo computacional.
Conclusiones:
- Los actuales LLM de código abierto no son lo suficientemente precisos como para reemplazar a los revisores humanos.
- Si bien los LLM muestran potencial de equidad al reducir el sesgo de afiliación, sus limitaciones de precisión requieren supervisión humana.
- Mistral ofreció el mejor equilibrio entre precisión y eficiencia; RAG es una prometedora estrategia de iniciación.
Videos de Conceptos Relacionados
Language
Corballis and Suddendorf (2007) and Tomasello and Rakoczy (2003) highlight the role of language in...
Mechanistic Models: Compartment Models in Algorithms for Numerical Problem Solving
In individual population analyses, different algorithms are employed, such as Cauchy's method, which uses a...
Review and Preview
Percentiles are a type of fractile that partition data into...
Review and Preview
Reliability and Validity
Influence of Parents and Peers on Identity
Parental Influence on Identity Development
Parents serve as primary guides and managers in an adolescent's life, offering support instrumental in decision-making and personal growth....

