Video Experimental Relacionado
Updated: Jun 19, 2026

A Postoperative Evaluation Guideline for Computer-Assisted Reconstruction of the Mandible
Published on: January 28, 2020
¿Pueden los modelos de lenguaje grandes ser una herramienta viable para los grupos de trabajo de consenso?
Frank G Lee1, Ellen L Larson1, Jane Vermunt1
1Division of Colon and Rectal Surgery, Mayo Clinic, Rochester, Minnesota.
OpenEvidence demostró una calidad superior en la adecuación del contenido y la calidad de las citas en comparación con Gemini y ChatGPT en un estudio sobre la síntesis de literatura sobre ventrorectopexia. Los expertos no pudieron distinguir el texto generado por el chatbot del consenso humano.
Área de la Ciencia:
- Informática Médica
- Inteligencia Artificial en Medicina
- Síntesis de Literatura Quirúrgica
Sus antecedentes:
- Una actualización reciente del consenso sobre la ventrorectopexia fue publicada por el Panel Internacional de Expertos en Ventrorectopexia.
- El estudio evaluó la capacidad de los modelos de lenguaje grandes (LLM) para sintetizar la literatura sobre ventrorectopexia antes de la publicación del consenso.
Objetivo del estudio:
- Comparar el rendimiento de diferentes LLM, incluidos ChatGPT-4o, Gemini 1.5 Pro y OpenEvidence, en la generación de respuestas y citas relacionadas con la ventrorectopexia.
- Utilizar el consenso del panel de expertos como punto de referencia para evaluar el rendimiento de los LLM.
Principales métodos:
- Los LLM se evaluaron en cuanto a adecuación del contenido, legibilidad, longitud de la respuesta, fabricación de citas y calidad de las citas.
- Un panel de cirujanos colorrectales evaluó el texto generado por los LLM en cuanto a adecuación e intentó distinguirlo del consenso de expertos.
Principales resultados:
- OpenEvidence logró la mayor adecuación del contenido (3.5/5), superando a Gemini (3.0/5) y ChatGPT (2.8/5).
- ChatGPT exhibió la mayor verbosidad y legibilidad, pero fabricó el 53% de sus citas, en comparación con el 12% de Gemini y el 0% de OpenEvidence.
- Los cirujanos colorrectales pudieron identificar el texto generado por el chatbot con un 55% de precisión.
Conclusiones:
- OpenEvidence se destacó en la adecuación del contenido y la calidad de las citas sobre Gemini y ChatGPT.
- El texto generado por los LLM fue indistinguible del consenso de expertos para los especialistas.
- Los LLM pueden servir como valiosas herramientas de investigación para futuros grupos de consenso con la debida divulgación y supervisión.
Videos de Conceptos Relacionados
Stereotype Content Model
Mechanistic Models: Compartment Models in Algorithms for Numerical Problem Solving
In individual population analyses, different algorithms are employed, such as Cauchy's method, which uses a...

