Video Experimental Relacionado
Updated: Sep 9, 2025

A Concoction Pipeline for Generating Molecular Operational Taxonomic Units (MOTUs) Among Riparian and Aquatic Beetles
Published on: July 11, 2025
Los grandes modelos de lenguaje pueden extraer datos morfológicos de las descripciones taxonómicas, pero su
Alexander N Schmidt-Lebuhn1, Nunzio Knerr1
1CSIRO, Centre for Australian National Biodiversity Research (a joint venture of Parks Australia and CSIRO), Clunies Ross Street, Canberra ACT 2601, Australia Centre for Australian National Biodiversity Research Canberra Australia.
Los grandes modelos de lenguaje (LLM) pueden extraer datos morfológicos de la literatura taxonómica, pero las instrucciones precisas son cruciales para la precisión y la reproducibilidad. El rendimiento de LLM varió, con modelos de código abierto que muestran una menor consistencia que los propietarios.
Área de la Ciencia:
- Botánica y taxonomía
- Biología computacional
- La bioinformática
Sus antecedentes:
- Los datos morfológicos son vitales para la taxonomía, la biología evolutiva, la ecología y la identificación de especies.
- Falta una base de datos centralizada para los datos morfológicos, a diferencia de las secuencias de ADN o los datos de muestras.
- Los datos morfológicos están predominantemente "encerrados" en la literatura taxonómica, lo que dificulta la accesibilidad.
Objetivo del estudio:
- Explorar la viabilidad del uso de grandes modelos lingüísticos (LLM) y el reconocimiento óptico de caracteres (OCR) para la extracción automatizada de datos morfológicos.
- Poblar una tabla de taxones × caracteres con 51 caracteres morfológicos para las Asteraceae nativas e introducidas de Australia.
- Evaluar la exactitud, la reproducibilidad y las limitaciones de los LLM en los datos morfológicos mineros de las descripciones taxonómicas.
Principales métodos:
- Utilizó ChatGPT 4o para procesar 1.121 descripciones taxonómicas de las Asteraceae australianas.
- Se han extraído datos para 51 caracteres morfológicos de 945 taxones (95 géneros, 838 especies/taxones infraespecíficos).
- Evaluación de la precisión de los datos mediante comprobación visual y evaluación de la reproducibilidad mediante la repetición de inferencias con el mismo LLM de código abierto.
Principales resultados:
- Se logró una tasa de datos faltantes del 51,1% y una tasa de error general del 5,8% en los controles visuales.
- Las tasas de error fueron más bajas para los caracteres cypsela y pappus (2,1%), con errores comunes que involucran confusión de bract y involucro.
- Los LLM propietarios mostraron una mayor reproducibilidad (78,9% de celdas consistentes) que los LLM de código abierto, que exhibieron errores de unidad y caracteres omitidos.
Conclusiones:
- La extracción de descripciones morfológicas basadas en LLM es factible, pero requiere instrucciones extremadamente precisas.
- Los LLM son inherentemente probabilísticos, lo que plantea desafíos para la plena reproducibilidad y integración en flujos de trabajo automatizados en comparación con los scripts.
- La investigación futura debería investigar la generación aumentada de recuperación o el ajuste fino para mejorar el rendimiento de LLM en la extracción de datos morfológicos.
Videos de Conceptos Relacionados
Light Acquisition
Pollination and Flower Structure
Basic Plant Anatomy: Roots, Stems, and Leaves
Genome Annotation and Assembly
Evolutionary Relationships through Genome Comparisons
Taxonomy
Hierarchy of Taxonomy
The hierarchy that Carolus Linnaeus first...

