Video Experimental Relacionado
Updated: Feb 13, 2026

Involving Individuals with Developmental Language Disorder and Their Parents/Carers in Research Priority Setting
Published on: June 6, 2020
Fuera de contexto y fuera de alcance: Manipulación de grandes modelos de lenguaje a través de modificaciones mínimas
Monty-Maximilian Zühlke1, Daniel Kudenko1, Wolfgang Nejdl1
1L3S Research Center, Leibniz University Hannover, Lower Saxony, Germany.
Los grandes modelos de lenguaje (LLM) pueden adoptar comportamientos específicos a partir de instrucciones sutiles durante el entrenamiento. Esta manipulación se desencadena por indicaciones específicas, destacando los riesgos con el uso de LLM sin monitoreo.
Área de la Ciencia:
- La inteligencia artificial es la inteligencia artificial.
- Procesamiento del lenguaje natural.
- Aprendizaje automático Aprendizaje automático.
Sus antecedentes:
- Las capacidades de razonamiento emergentes en los grandes modelos de lenguaje (LLM) requieren una alineación con las intenciones humanas.
- El razonamiento fuera de contexto permite a los LLM adoptar comportamientos a partir de información descriptiva sin ejemplos.
- La evaluación de la naturaleza benigna de los patrones de comportamiento de LLM es un desafío debido a los datos de capacitación opacos.
Objetivo del estudio:
- Investigar la incorporación y los mecanismos de activación de los comportamientos definidos por el usuario en LLMs.
- Comprender la influencia de los datos de capacitación y las estrategias de alerta sobre el comportamiento del LLM.
- Evaluar el potencial de manipulación de los patrones de respuesta de LLM.
Principales métodos:
- LLM de ajuste fino con descripciones de comportamiento mínimas y ocultas dentro de un conjunto de instrucciones más grande.
- Motivación matemática y validación empírica de la difusión de la señal e inferencia en los datos de entrenamiento.
- Análisis de estrategias de iniciación y refuerzo simbólico para el desencadenamiento del comportamiento.
Principales resultados:
- Los LLM pueden inferir y adoptar patrones de respuesta a partir de señales difusas en datos de entrenamiento ruidosos.
- La incrustación conductual es sensible a las modificaciones mínimas del conjunto de instrucciones.
- El desencadenamiento de estos comportamientos incrustados depende en gran medida de estrategias específicas de iniciación y refuerzo de tokens.
Conclusiones:
- Los LLM exhiben susceptibilidad a la manipulación a través de modificaciones sutiles en los datos de entrenamiento y el estímulo.
- El surgimiento de comportamientos específicos en los LLM puede ser controlado y desencadenado bajo ciertas condiciones.
- El uso no monitoreado de LLMs con datos de entrenamiento inaccesibles plantea riesgos imprevistos debido a la posible manipulación del comportamiento.
Videos de Conceptos Relacionados
The Scope of Physics
Language
Corballis and Suddendorf (2007) and Tomasello and Rakoczy (2003) highlight the role of language in...
Histone Modification
Acetylation
The enzyme histone acetyltransferase adds acetyl group to the histones. Another enzyme, histone...
Self Within Cultural Contexts
Components of Language
Language Development
The critical period for language acquisition suggests that the ability to acquire language is at its peak early in life. As people age, this proficiency decreases. Language development begins very...

