Video Experimental Relacionado
Updated: Jan 22, 2026

Involving Individuals with Developmental Language Disorder and Their Parents/Carers in Research Priority Setting
Published on: June 6, 2020
Leyes de escala y aprendizaje de representaciones en lenguajes jerárquicos simples: Transformers versus arquitecturas
Francesco Cagnetta1, Alessandro Favero2, Antonio Sclocchi3
1Scuola Internazionale Superiore di Studi Avanzati, (SISSA), Via Bonomea 265, 34136 Trieste, Italy.
Los modelos de lenguaje neuronal aprenden la estructura del lenguaje a través de la predicción del siguiente token. Las redes convolucionales superan a los transformers debido a la alineación arquitectónica con la estructura de los datos, aclarando las leyes de escala neuronal.
Área de la Ciencia:
- Lingüística computacional
- Teoría del aprendizaje automático
- Arquitecturas de aprendizaje profundo
Sus antecedentes:
- Los modelos de lenguaje neuronal (NLMs) se entrenan en tareas de predicción del siguiente token.
- Comprender cómo los NLMs adquieren la estructura lingüística es una pregunta clave de investigación.
- Trabajos anteriores establecieron una teoría de aprendizaje de representaciones basada en correlaciones de datos.
Objetivo del estudio:
- Derivar leyes de escala teóricas para NLMs entrenados en datos sintéticos.
- Investigar el impacto de la arquitectura del modelo en el aprendizaje de la estructura lingüística.
- Extender la teoría de aprendizaje de representaciones existente para tener en cuenta las diferencias arquitectónicas.
Principales métodos:
- Desarrollo de leyes de escala teóricas para el rendimiento de redes neuronales.
- Utilización de conjuntos de datos sintéticos del modelo de jerarquía aleatoria (RHM).
- Extensión de la teoría de aprendizaje de representaciones para incorporar variaciones arquitectónicas.
Principales resultados:
- Las redes convolucionales muestran una escala de rendimiento más rápida que los modelos transformer.
- Se identifican sesgos arquitectónicos en las leyes de escala neuronal.
- Predicciones validadas empíricamente sobre el rendimiento de la red.
Conclusiones:
- La arquitectura del modelo influye significativamente en cómo los NLMs aprenden la estructura lingüística.
- La alineación entre la arquitectura de la red y las propiedades estadísticas de los datos es crucial.
- Los hallazgos aclaran la interacción entre arquitectura, datos y aprendizaje de representaciones en NLMs.
Más Videos Relacionados
Videos de Conceptos Relacionados
Convolution Properties II
The width property indicates that if the durations of input signals are T1 and T2, then the width of the output response equals the sum of both durations, irrespective of the shapes of the two functions. For instance, convolving two rectangular pulses with durations of 2 seconds and 1 second results in a function with a width of 3 seconds.
The area property asserts that the area under the...
Second Law of Thermodynamics
First Law of Thermodynamics
First Law of Thermodynamics
Language
Corballis and Suddendorf (2007) and Tomasello and Rakoczy (2003) highlight the role of language in...
Gas Laws: Boyle's, Gay-Lussac, Charles', Avogadro's, and Ideal Gas Law

