Video Experimental Relacionado
Updated: Sep 9, 2025

Three Laboratory Procedures for Assessing Different Manifestations of Impulsivity in Rats
Published on: March 17, 2019
La evolución de la histeresis de elección en el aprendizaje por refuerzo: Comparando el valor adaptativo del sesgo de
Isabelle Hoxha1,2, Léo Sperber1,2, Stefano Palminteri1,2
1Département d'Etudes Cognitives, École Normale Supérieure, Université de Recherche Paris Sciences et Lettres, Paris 75005, France.
Los sesgos en el aprendizaje por refuerzo, como la repetición de elecciones pasadas, pueden ser adaptativos. El sesgo de positividad es evolutivamente estable en muchos entornos, a diferencia de la perseverancia gradual de la elección.
Área de la Ciencia:
- Ciencias cognitivas
- Neurociencia computacional
- Economía del comportamiento
Sus antecedentes:
- Los experimentos de aprendizaje por refuerzo con frecuencia muestran una tendencia a repetir las elecciones pasadas más allá de lo que predice la historia.
- Esta repetición de la elección a menudo se explica por actualizaciones asimétricas o perseverancia gradual de la elección.
- Un metanálisis confirmó estos mecanismos en el aprendizaje de refuerzo humano, pero su valor adaptativo sigue siendo incomparable.
Objetivo del estudio:
- Investigar el valor adaptativo de los procesos computacionales subyacentes a la repetición de elecciones en el aprendizaje por refuerzo.
- Para comparar la estabilidad evolutiva de las actualizaciones asimétricas (sesgo de positividad) frente a la perseverancia gradual de la elección en diversos entornos.
Principales métodos:
- Agentes de aprendizaje por refuerzo simulados utilizando un algoritmo evolutivo en varios entornos simulados.
- Evaluó la estabilidad evolutiva y la robustez de diferentes mecanismos de repetición de la elección.
Principales resultados:
- Se encontró que el sesgo de positividad, que se manifiesta como actualizaciones asimétricas, es evolutivamente estable en numerosos escenarios simulados.
- La aparición de la perseverancia gradual de la elección fue menos consistente y robusta en comparación con el sesgo de positividad.
- El contexto ambiental influye significativamente en la selección adaptativa de estos sesgos.
Conclusiones:
- Los sesgos computacionales en el aprendizaje por refuerzo, como el sesgo de positividad, pueden ser adaptativos y favorecidos por la selección evolutiva.
- El valor adaptativo de estos sesgos es específico del entorno, destacando la interacción matizada entre el comportamiento y las presiones ecológicas.
- El sesgo de positividad demuestra una mayor robustez evolutiva que la perseverancia gradual de la elección en entornos probados.
Videos de Conceptos Relacionados
Avoidance Learning and Learned Helplessness
Avoidance learning occurs when an organism learns that a specific behavior can prevent an unpleasant outcome. For example, a student who receives a bad grade may start studying harder to avoid future poor grades. This behavior persists even when the negative outcome is no longer present. Avoidance learning is powerful because it maintains behavior in the absence of the...
Timing and Consequences on Behavior
Humans, however, can respond to delayed reinforcers. We often make decisions between immediate small rewards and delayed larger rewards. This ability to delay gratification is a significant...
Hindsight Biases
Generalization, Discrimination, and Extinction
Generalization occurs when a behavior reinforced in one context is performed in similar situations. For instance, a student who studies diligently for calculus and receives excellent grades might apply the same study habits to psychology and history, expecting similar results. Generalization shows how learning in one setting can influence behavior in...
Reinforcement
Positive reinforcement occurs when a behavior is followed by the presentation of a rewarding stimulus, increasing the frequency of that behavior. For example:
Instinctive Drift

