Video Experimental Relacionado
Updated: Jan 7, 2026

Author Spotlight: 3D Movement Assessment of Maxillary Posterior Teeth in Clear Aligner Treatment
Published on: February 23, 2024
Rendimiento de cinco grandes modelos de lenguaje gratuitos en traumatismos dentales: un estudio de referencia
Rafaela Mancini Lisboa1, Arian Braido2, Adriana de-Jesus-Soares2
1Departament of Dentistry, Centro Universitário das Faculdades Associadas de Ensino - UNIFAE, São João da Boa Vista, Brazil.
Microsoft Copilot y DeepSeek demostraron una alta precisión y consistencia en la respuesta a preguntas sobre traumatismos dentales, superando a otros grandes modelos de lenguaje (LLM). Su rendimiento se mantuvo estable durante 30 días, sin que la indicación de contexto tuviera un impacto significativo.
Área de la Ciencia:
- Inteligencia artificial en la atención médica
- Traumatología dental
- Sistemas de información médica
Sus antecedentes:
- Los grandes modelos de lenguaje (LLM) se utilizan cada vez más para la recuperación de información médica.
- La precisión y la consistencia de los LLM en campos especializados como los traumatismos dentales requieren una evaluación rigurosa.
Objetivo del estudio:
- Comparar la precisión y la consistencia de cinco LLM líderes en la generación de respuestas sobre traumatismos dentales.
- Evaluar el impacto de las estrategias de indicación en el rendimiento de los LLM en este dominio.
Principales métodos:
- Se plantearon sesenta preguntas de verdadero/falso sobre traumatismos dentales diariamente a cinco LLM (ChatGPT, Google Gemini, Microsoft Copilot, DeepSeek, Meta AI) durante 30 días.
- Las respuestas se evaluaron con respecto a las directrices de la Asociación Internacional de Traumatología Dental (IADT) utilizando análisis estadísticos, que incluyen sensibilidad, especificidad, precisión y AUC.
- La estabilidad temporal se evaluó mediante el coeficiente de correlación intraclase (ICC).
Principales resultados:
- Todos los LLM superaron el 85 % de precisión; Microsoft Copilot (91,1 %) y DeepSeek (90 %) mostraron el mayor rendimiento, sin diferencias significativas entre ellos.
- DeepSeek y Microsoft Copilot también exhibieron la mayor consistencia temporal (ICC > 0,90).
- La indicación de contexto no alteró significativamente la precisión o la estabilidad en todos los modelos.
Conclusiones:
- Microsoft Copilot y DeepSeek demuestran alta precisión y confiabilidad para la información sobre traumatismos dentales.
- El rendimiento de los LLM en traumatismos dentales es estable con el tiempo, lo que sugiere potencial para el apoyo clínico.
- Investigaciones futuras pueden explorar la integración de LLM en la educación dental y los recursos de información para pacientes.

