Video Experimental Relacionado
Updated: Jan 18, 2026

08:35
Identification of Alternative Splicing and Polyadenylation in RNA-seq Data
Published on: June 24, 2021
6.4K
PolyA-GLM: Un marco integral para la predicción de sitios de poliadenilación de novo utilizando modelos de lenguaje
Sourav Saha1, Naima Ahmed Fahmi1, Jeongsik Yong2
1Department of Computer Science, University of Central Florida, Orlando, FL, USA.
Computational and structural biotechnology journal
|January 16, 2026
Resumen
Los modelos de lenguaje genómico (GLM) predicen con precisión los sitios de poliadenilación (poli(A)), cruciales para la regulación de la expresión génica. Este estudio presenta PolyA-GLM, un pipeline que mejora la comprensión del procesamiento del ARN.
Área de la Ciencia:
- Genómica
- Biología Computacional
- Biología Molecular
Sus antecedentes:
- Los sitios de poliadenilación (poli(A)) son vitales para la regulación génica post-transcripcional.
- La predicción precisa de sitios de poli(A) ayuda a identificar defectos en el procesamiento del ARN en enfermedades como el cáncer.
- Los métodos tradicionales enfrentan limitaciones en la generalización inter-especies y entre tipos de células.
Objetivo del estudio:
- Evaluar los modelos de lenguaje genómico (GLM) para la predicción precisa de sitios de poli(A).
- Aprovechar la capacidad de los GLM para capturar dependencias de secuencias genómicas de largo alcance.
- Desarrollar un pipeline de extremo a extremo para el descubrimiento de nuevos sitios de poli(A).
Principales métodos:
- Se evaluaron DNABERT-2, Nucleotide Transformer e HyenaDNA utilizando clasificación con pocos ejemplos y ajuste.
- Se evaluó el rendimiento del modelo en el reconocimiento de señales de poliadenilación canónicas (PAS) y su proximidad a los sitios de escisión.
- Se empleó la perturbación sistemática de señales para la validación de la interpretabilidad del modelo.
Principales resultados:
- Los GLM reconocieron eficazmente los PAS canónicos y sus relaciones espaciales con los sitios de escisión.
- HyenaDNA logró un AUC de 0.751 en el aprendizaje con pocos ejemplos, con mejoras de rendimiento después del ajuste.
- Un enfoque de clasificación a nivel de token permitió la identificación precisa y posición a posición de los sitios de poli(A).
Conclusiones:
- Los modelos de lenguaje genómico muestran una promesa significativa para avanzar en la predicción de sitios de poli(A).
- El pipeline PolyA-GLM facilita el descubrimiento de nuevos elementos reguladores.
- Los GLM ofrecen un enfoque potente para comprender el procesamiento del ARN y la regulación génica.
Palabras clave:
Pruebas inter-especiesPredicción de sitios de poliadenilación de novoAprendizaje con pocos ejemplosModelos de lenguaje genómicoRegulación post-transcripcionalModelos Transformer
